Privacy & Security

AI 知識庫與機密性:每位服務提供者在錄製客戶對話前都應提出的 7 個問題

能錄製並索引客戶對話的 AI 很強大——但前提是你清楚知道由誰給予同意、資料儲存在哪裡,以及你如何再次離開

The Wux Webtools Team The Wux Webtools Team 9 分鐘閱讀 AI輔助,人類審核
Moderne Europese datacenteromgeving met glazen serverruimte en laptop met toestemmingsdialoog, symboliseert transparantie en beveiliging bij AI-kennisbanken
目錄
  1. 為什麼寫這篇文章
  2. 1. 誰同意錄製——以及你如何記錄該同意?
  3. 2. 資料實際儲存在哪裡,適用哪一國法律?
  4. 3. 哪個模型會處理逐字稿?逐字稿是否會用於訓練?
  5. 4. 你會保留錄製內容與嵌入向量多久?誰可以刪除它們?
  6. 5. 有哪些稽核日誌可用——客戶日後能否看到「他們的」對話發生了什麼?
  7. 6. 退出策略是什麼?(你能否以開放格式匯出你的知識庫?)
  8. 7. 誰是處理者、誰是控制者?這是否記錄在資料處理協議中?
  9. TL;DR 檢查清單
  10. 這對你的組織意味著什麼

為什麼寫這篇文章

能錄製、轉錄並讓客戶對話可被搜尋的 AI 知識庫,對服務提供者來說是重大的生產力提升。我們先前曾撰文說明,AI 知識庫如何在每個專案中終於因你的公司而變得聰明——但一旦你開始擷取語音、影片或聊天內容,討論就會從「實用工具」轉向「法律評估」。

本文是一份包含七個問題的檢查清單;在部署像 Symphoria(Wux Webtools 的合作夥伴,也是我們自己使用的平台)這樣的工具或替代方案之前,你必須能夠回答這些問題。這些問題根據 GDPR、EU AI Act、EDPB 指引,以及荷蘭服務提供者的日常實務而來;他們希望維持合規,同時不讓合規使工作停擺。

情境是:你是一位服務提供者——顧問公司、開發者、行銷代理商、會計師——協助客戶進行持續數月、產生數十次對話的專案。你希望 AI 能摘要這些對話、擷取待辦事項,並回答像是「客戶上週對預算說了什麼?」這類問題。這是可行的。但不能沒有以下七個答案。


1. 誰同意錄製——以及你如何記錄該同意?

GDPR 要求每一項個人資料處理都必須有合法依據(Art. 6)。對於對話錄製,你通常需要 同意(Art. 6(1)(a))或 正當利益(Art. 6(1)(f))。同意必須是 事前特定知情自由給予 的(Art. 7)。這代表:不能有預先勾選的方框,不能把條款藏在服務條款中,更不能是「除非你反對,否則我們會錄製」。

你應該看到的內容: 在第一次對話被錄製之前,有明確的選擇加入時點。這可以是專案導入流程中的核取方塊(「我同意為專案文件記錄與 AI 支援之目的錄製會議」)、通話開始時的口頭確認(「本通話將為我們的內部知識庫而錄製——你同意嗎?」),或是一封獨立的同意電子郵件。同意必須被記錄:誰、何時、為了什麼目的,以及使用了哪些文字。

Symphoria 如何解決這一點: Symphoria 針對每個專案提供同意層。在錄製開始前,系統會明確詢問所有參與者是否同意。該同意會連同時間戳記與 IP 位址一起儲存,並可按專案撤回。這讓遵循 Art. 7(3) GDPR(「撤回同意應與給予同意一樣容易」)變得更容易。


2. 資料實際儲存在哪裡,適用哪一國法律?

原則上,GDPR 禁止在沒有適當保障措施的情況下,將個人資料傳輸至 EEA 以外的國家(Arts. 44-50)。在 Schrems II 判決(2020)之後,如果接收方受美國 FISA 702 等監控法規約束,標準契約條款(SCCs)已不再足夠。EU AI Act(2024)又增加了一層要求:高風險 AI 系統必須符合透明度與稽核要求;若資料儲存在歐盟以外,這些要求將難以執行。

你應該看到的內容: 關於資料實際儲存地點(哪個資料中心、哪個國家)、哪些次處理者可以存取,以及這些當事方是否受非歐洲監控法規約束的明確聲明。理想情況是:資料儲存在歐盟境內,並由沒有美國母公司,或明確提供「EU-only」模式的供應商提供服務。

Symphoria 如何解決這一點: Symphoria 完全運行於歐洲基礎設施(AWS eu-west-1,法蘭克福),且不使用美國次處理者來儲存或處理逐字稿。這使得遵循 Schrems II 更容易,而不需要複雜的影響評估。


3. 哪個模型會處理逐字稿?逐字稿是否會用於訓練?

多數 AI 知識庫會使用外部 LLM(OpenAI、Anthropic、Google)來處理逐字稿。這會帶來兩個問題:(1) 逐字稿是否會用於訓練模型?以及 (2) 誰可以存取提示詞與回應?OpenAI 的 API 條款自 2023 年 3 月起已聲明,透過 API 傳送的資料不會用於訓練——除非你透過獨立方案明確選擇加入。但這項保證並不適用於所有提供者,當然也不適用於免費或「研究」存取。

你應該看到的內容: 明確聲明逐字稿不會用於模型訓練,且在處理後,LLM 提供者不再能存取這些逐字稿。這必須包含在資料處理協議中,而不只是 FAQ 裡的說法。加分項:該平台使用你可以自行託管的模型(例如 Llama、Mistral),或使用具有嚴格不訓練條款的歐洲提供者。

Symphoria 如何解決這一點: Symphoria 使用 OpenAI 的 API,並具備 Business Associate Agreement (BAA) 與不訓練條款。逐字稿會透過 API 處理,但不會由 OpenAI 儲存,也不會納入未來的模型版本。這一點在次處理者清單中有明確說明。


4. 你會保留錄製內容與嵌入向量多久?誰可以刪除它們?

GDPR 要求個人資料的保存期間不得長於其蒐集目的所需期間(Art. 5(1)(e):儲存限制)。對 AI 知識庫而言,這表示你必須能夠說明六個月前的一段錄製內容為何仍具相關性,並且必須有刪除舊資料的流程。這也適用於衍生資料:如果嵌入向量(文字的向量表示)可以追溯到個人,它們就是個人資料。

你應該看到的內容: 每個專案可設定的保留期間(例如「12 個月後自動刪除錄製內容」)、允許專案經理手動刪除錄製內容的按鈕,以及刪除也會影響嵌入向量與索引的保證——而不只是刪除音訊檔案。理想情況是:有稽核日誌顯示某項內容在何時、由刪除。

Symphoria 如何解決這一點: Symphoria 為每個專案提供「保留政策」。你可以設定錄製內容在 X 個月後自動刪除,包括逐字稿與嵌入向量。也可以透過專案介面手動刪除,且每次刪除都會記錄在稽核軌跡中。


5. 有哪些稽核日誌可用——客戶日後能否看到「他們的」對話發生了什麼?

透明性是 GDPR 的核心原則(Art. 5(1)(a))。這代表你必須能夠說明你對某人的資料做了什麼——即使事後也一樣。對 AI 知識庫而言,這代表你必須能夠顯示做了哪些錄製、誰看過它們、執行了哪些查詢,以及資料是否被匯出或刪除。沒有稽核日誌,你就無法回答這些問題;若發生資料外洩或投訴,也會面臨罰款風險。

你應該看到的內容: 每個專案都有稽核日誌,至少追蹤:(1) 誰開始錄製,(2) 誰查看了逐字稿,(3) 對知識庫執行了哪些查詢,(4) 資料是否被匯出,以及 (5) 資料是否被刪除。該日誌必須可搜尋,並至少保留 12 個月(若你在受監管產業工作,則需更久)。

Symphoria 如何解決這一點: Symphoria 會在專案層級記錄所有動作:錄製、檢視、查詢、匯出與刪除。這些日誌可由專案擁有者存取,並能以 CSV 匯出。這使得回應存取請求(Art. 15 GDPR)或調查事件變得更容易。


6. 退出策略是什麼?(你能否以開放格式匯出你的知識庫?)

供應商鎖定是每個 SaaS 工具都存在的風險,但對 AI 知識庫而言尤其痛苦:你已經蒐集了數月的對話、逐字稿與中繼資料;如果無法匯出,就會失去這些知識。GDPR 賦予你資料可攜權(Art. 20),但這只適用於你自行提供的資料——不適用於嵌入向量或摘要等衍生資料。即便如此,要求能以可匯入另一家提供者的格式匯出所有內容,仍是明智之舉。

你應該看到的內容: 一個匯出按鈕,至少提供:(1) 所有音訊或影片檔案,(2) 以純文字或 JSON 呈現的所有逐字稿,(3) 所有中繼資料(時間戳記、參與者、標籤),以及 (4) 理想情況下,還能以 Parquet 或 JSONL 等開放格式提供嵌入向量。加分項:匯出可自動化並可排程(例如每週備份到你自己的 S3 bucket)。


7. 誰是處理者、誰是控制者?這是否記錄在資料處理協議中?

GDPR 區分 控制者(決定為何以及如何處理個人資料的一方)與 處理者(代表控制者處理資料的一方)。作為服務提供者,你通常是控制者,而 AI 知識庫是處理者。這代表你需要一份 資料處理協議(Art. 28 GDPR),精確列明處理者可以做什麼、持續多久、使用哪些次處理者,以及發生資料外洩時會如何處理。

你應該看到的內容: 符合 Art. 28(3) GDPR 的 Data Processing Agreement (DPA)。它至少必須包含:(1) 處理的標的與期間,(2) 處理的性質與目的,(3) 個人資料類型與資料主體類別,(4) 控制者的權利與義務,(5) 次處理者清單,以及 (6) 資料外洩程序。該協議必須在你開始錄製前簽署。

Symphoria 如何解決這一點: Symphoria 提供符合 Art. 28 GDPR 的標準 DPA。你可以透過平台介面簽署,且當新增次處理者時會自動更新。這讓你不必每次都牽涉法律團隊,也更容易維持合規。


TL;DR 檢查清單

  • 同意: 記錄事前、特定的同意——包含時間戳記與退出選項。
  • 儲存: 檢查資料是否儲存在歐盟境內,且不受非歐洲監控法規約束。
  • 訓練: 要求明確保證逐字稿不會用於模型訓練。
  • 保留: 設定保留期間,並確保刪除也會影響嵌入向量。
  • 稽核: 要求記錄誰查看、查詢及刪除了什麼。
  • 匯出: 檢查你是否能以開放格式匯出所有資料。
  • DPA: 在開始錄製前簽署資料處理協議。

這對你的組織意味著什麼

如果你能回答這七個問題,就已經走在正確的路上。但請注意:合規不是一次性的檢查清單。GDPR 要求你定期驗證自己仍然符合要求(Art. 24:「適當的技術與組織措施」),而 EU AI Act 對高風險系統又增加了另一層要求。這代表:定期稽核、針對新使用情境進行 DPIA,以及建立回應存取請求與資料外洩的流程。

想看看這在實務上如何運作嗎?閱讀與 AI 知識庫共處的一週:它如何改變服務提供者專案經理的工作——這是一個敘事案例,我們在其中精確展示這些問題如何在日常實務中浮現。

關鍵教訓是:只有在你保有客戶信任時,AI 知識庫才會成為生產力提升。而你是在按下「錄製」之前,透過提出——並能夠回答——這些問題來贏得信任。

常見問題

在使用 AI 知識庫之前,我需要進行 DPIA 嗎?
這取決於風險。如果你處理特殊類別的個人資料(Art. 9 GDPR:健康、刑事犯罪資料等),或大規模系統性監控行為,DPIA 是強制性的(Art. 35 GDPR)。對於多數只錄製商務對話的服務提供者而言,DPIA 不是強制性的,但建議進行——尤其是當你的客戶來自受監管產業時。
如果發生資料外洩,誰負責:我還是 AI 提供者?
作為控制者,你始終承擔最終責任(Art. 24 GDPR)。但如果外洩是由處理者(AI 提供者)造成,你可以要求其負責——前提是你有一份完善且對此加以規範的資料處理協議。這就是為什麼具有明確資料外洩程序的 DPA 至關重要。
如果是內部會議,我可以在未取得同意的情況下錄製嗎?
這取決於合法依據。對於內部會議,有時你可以依賴正當利益(Art. 6(1)(f) GDPR),但你必須能夠證明該利益高於相關個人的隱私。在實務上,即使在內部也詢問同意會更安全——尤其是當錄製內容會由 AI 索引時。
如果客戶事後撤回同意怎麼辦?
那麼你必須刪除錄製內容,除非你有另一個合法依據(例如契約必要性)。GDPR 要求撤回同意必須與給予同意一樣容易(Art. 7(3))。這代表:你的平台中要有一個允許客戶撤回同意的按鈕,並有流程確保錄製內容在合理期間內刪除(通常為 30 天)。
我可以與第三方分享逐字稿嗎(例如參與專案的自由工作者)?
只有在這屬於同意所涵蓋的目的範圍內,且第三方也受資料處理協議約束時才可以。這代表:如果你聘請需要存取知識庫的自由工作者,該自由工作者必須簽署 NDA 與次處理者條款。
EU AI Act 怎麼看——AI 知識庫是否屬於「高風險」?
可能不是。EU AI Act 將高風險 AI 定義為用於關鍵領域的系統(例如招募、信用評分、執法)。僅用於內部專案文件記錄的 AI 知識庫通常不屬於該類別。但如果你使用 AI 對個人做出決策(例如根據錄製內容進行績效評估),它就可能成為高風險。

來源與進一步閱讀

  1. Algemene Verordening Gegevensbescherming (AVG) — Volledige tekst
  2. EU AI Act — Verordening (EU) 2024/1689
  3. EDPB Guidelines 05/2020 on consent under Regulation 2016/679
  4. Autoriteit Persoonsgegevens — Toestemming vragen
  5. Schrems II: CJEU judgment C-311/18 (Data Protection Commissioner v Facebook Ireland and Maximillian Schrems)
  6. CNIL — Transferts de données hors UE
關於作者
The Wux Webtools Team

最後更新:

繼續閱讀