Privacy & Security

AI 知识库与保密性:服务提供商在录制客户对话前应询问的 7 个问题

能够录制并索引客户对话的 AI 很强大——但前提是你清楚知道谁给予了同意、数据存储在哪里,以及你如何再次退出

The Wux Webtools Team The Wux Webtools Team 9 分钟阅读 人工智能辅助,人工审核
Moderne Europese datacenteromgeving met glazen serverruimte en laptop met toestemmingsdialoog, symboliseert transparantie en beveiliging bij AI-kennisbanken
目录
  1. 为什么写这篇文章
  2. 1. 谁同意录制——你如何记录该同意?
  3. 2. 数据实际存储在哪里,适用哪一项法律?
  4. 3. 哪个模型处理转写文本,它们是否被用于训练?
  5. 4. 录音和 embeddings 保留多久,谁可以删除它们?
  6. 5. 有哪些审计日志——客户以后能否看到“他们的”对话发生了什么?
  7. 6. 退出策略是什么?(你能否以开放格式导出知识库?)
  8. 7. 谁是处理者,谁是控制者,这是否记录在数据处理协议中?
  9. TL;DR 清单
  10. 这对你的组织意味着什么

为什么写这篇文章

对于服务提供商而言,能够录制、转写并让客户对话可搜索的 AI 知识库,是一次显著的生产力提升。我们此前写过 AI 知识库如何按项目从你的公司知识中真正变得聪明——但一旦你开始采集语音、视频或聊天内容,讨论就会从“有用工具”转向“法律评估”。

本文是一份包含七个问题的清单。在部署像 Symphoria(Wux Webtools 的合作伙伴,也是我们自己使用的平台)这样的工具或其他替代方案之前,你需要能够回答这些问题。这些问题基于 GDPR、EU AI Act、EDPB 指南,以及荷兰服务提供商的日常实践:他们希望保持合规,同时不让合规使工作停摆。

背景是:你是一家服务提供商——咨询公司、开发者、营销机构、会计师——帮助客户完成持续数月并产生数十次对话的项目。你希望 AI 能总结这些对话、提取行动项,并回答诸如“客户上周关于预算说了什么?”这样的问题。这是可以做到的。但前提是你先回答下面这七个问题。


1. 谁同意录制——你如何记录该同意?

GDPR 要求每一次个人数据处理都必须有合法依据(第 6 条)。对于对话录音,你通常需要同意(第 6(1)(a) 条)或合法利益(第 6(1)(f) 条)。同意必须是事先的具体的知情的,并且是自由作出的(第 7 条)。这意味着:不能使用预先勾选的复选框,不能把条款隐藏在服务条款中,更不能说“除非你反对,否则我们会录制”。

你应当看到的是: 在第一次对话被录制之前,有一个清晰的选择加入时刻。它可以是项目入职流程中的一个复选框(“我同意为项目文档和 AI 支持之目的录制会议”),也可以是在通话开始时的口头确认(“本次通话将被录制并用于我们的内部知识库——你是否同意?”),或是一封单独的同意邮件。同意必须被记录:谁、何时、出于什么目的,以及使用了哪些措辞。

Symphoria 如何解决这一点: Symphoria 为每个项目提供同意层。在录制开始前,系统会明确要求所有参与者给予同意。该同意会连同时间戳和 IP 地址一起存储,并可按项目撤回。这使得遵守 GDPR 第 7(3) 条(“撤回同意应当与给予同意一样容易”)更加简单。


2. 数据实际存储在哪里,适用哪一项法律?

原则上,GDPR 禁止在没有适当保障措施的情况下,将个人数据传输到 EEA 以外的国家(第 44-50 条)。在 Schrems II 判决(2020 年)之后,如果接收方受美国 FISA 702 等监控立法约束,标准合同条款(SCCs)本身已不再充分。EU AI Act(2024 年)又增加了一层要求:高风险 AI 系统必须满足透明度和审计要求;如果数据存储在欧盟以外,这些要求会很难执行。

你应当看到的是: 对数据实际存储位置的清晰说明(哪个数据中心、哪个国家)、哪些子处理方可以访问,以及这些方是否受非欧洲监控立法约束。理想情况是:数据存储在欧盟境内,且提供商没有美国母公司,或明确提供“仅限欧盟”模式。

Symphoria 如何解决这一点: Symphoria 完全运行在欧洲基础设施上(AWS eu-west-1, Frankfurt),且不使用美国子处理方来存储或处理转写文本。这使得在无需复杂影响评估的情况下,更容易遵守 Schrems II。


3. 哪个模型处理转写文本,它们是否被用于训练?

大多数 AI 知识库使用外部 LLM(OpenAI、Anthropic、Google)来处理转写文本。这会引出两个问题:(1) 转写文本是否被用于训练模型?以及 (2) 谁可以访问提示词和响应?OpenAI 的 API 条款自 2023 年 3 月起声明,通过 API 发送的数据不会被用于训练——除非你通过单独计划明确选择加入。但这一保证并不适用于所有提供商,当然也不适用于免费或“研究”访问。

你应当看到的是: 明确声明转写文本不会被用于模型训练,并且在处理完成后,LLM 提供商不再能够访问这些内容。这必须写入数据处理协议,而不只是出现在 FAQ 中。加分项:平台使用你可以自行托管的模型(例如 Llama、Mistral),或使用带有严格不训练条款的欧洲提供商。

Symphoria 如何解决这一点: Symphoria 使用 OpenAI 的 API,并配有 Business Associate Agreement (BAA) 和不训练条款。转写文本通过 API 处理,但不会被 OpenAI 存储,也不会被纳入未来的模型版本。这一点在子处理方清单中有明确说明。


4. 录音和 embeddings 保留多久,谁可以删除它们?

GDPR 要求个人数据的保存时间不得超过其收集目的所必需的期限(第 5(1)(e) 条:存储限制)。对于 AI 知识库而言,这意味着你必须能够解释为什么六个月前的一段录音仍然相关,并且必须有删除旧数据的流程。这同样适用于衍生数据:如果 embeddings(文本的向量表示)能够追溯到个人,它们就是个人数据。

你应当看到的是: 可按项目配置的保留期限(例如“12 个月后自动删除录音”)、允许项目经理手动删除录音的按钮,以及确保删除也会影响 embeddings 和索引的保证——而不只是删除音频文件。理想情况是:审计日志显示何时删除了某项内容以及由谁删除。

Symphoria 如何解决这一点: Symphoria 为每个项目提供“保留策略”。你可以配置录音在 X 个月后自动删除,包括转写文本和 embeddings。也可以通过项目界面手动删除,并且每一次删除都会记录在审计轨迹中。


5. 有哪些审计日志——客户以后能否看到“他们的”对话发生了什么?

透明度是 GDPR 的核心原则(第 5(1)(a) 条)。这意味着你必须能够解释你对某人的数据做了什么——即使是在事后。对于 AI 知识库而言,这意味着你必须能够展示哪些录音被创建、谁查看过它们、运行了哪些查询,以及数据是否被导出或删除。没有审计日志,你就无法回答这些问题,并且在发生数据泄露或投诉时面临罚款风险。

你应当看到的是: 每个项目都有审计日志,至少跟踪:(1) 谁开始了录制,(2) 谁查看了转写文本,(3) 针对知识库运行了哪些查询,(4) 数据是否被导出,以及 (5) 数据是否被删除。该日志必须可搜索,并至少保留 12 个月(如果你处于受监管行业,则应更久)。

Symphoria 如何解决这一点: Symphoria 在项目层级记录所有操作:录制、查看、查询、导出和删除。这些日志可供项目所有者访问,并可导出为 CSV。这使得遵守访问请求(GDPR 第 15 条)或调查事件更加容易。


6. 退出策略是什么?(你能否以开放格式导出知识库?)

供应商锁定是每个 SaaS 工具都存在的风险,但对 AI 知识库而言尤其令人痛苦:你收集了数月的对话、转写文本和元数据;如果无法导出,就会失去这些知识。GDPR 赋予你数据可携权(第 20 条),但它只适用于你自己提供的数据——不适用于 embeddings 或摘要等衍生数据。尽管如此,明智的做法是要求你能够以可导入其他提供商的格式导出所有内容

你应当看到的是: 一个导出按钮,至少向你提供:(1) 所有音频或视频文件,(2) 所有纯文本或 JSON 格式的转写文本,(3) 所有元数据(时间戳、参与者、标签),以及 (4) 理想情况下,还包括 Parquet 或 JSONL 等开放格式的 embeddings。加分项:导出可以自动化并按计划执行(例如每周备份到你自己的 S3 bucket)。


7. 谁是处理者,谁是控制者,这是否记录在数据处理协议中?

GDPR 区分控制者(决定为何以及如何处理个人数据的一方)和处理者(代表控制者处理数据的一方)。作为服务提供商,你通常是控制者,而 AI 知识库是处理者。这意味着你需要一份数据处理协议(GDPR 第 28 条),其中精确规定处理者可以做什么、做多久、使用哪些子处理方,以及发生数据泄露时如何处理。

你应当看到的是: 一份符合 GDPR 第 28(3) 条的数据处理协议(DPA)。它至少必须包括:(1) 处理的主题事项和期限,(2) 处理的性质和目的,(3) 个人数据类型和数据主体类别,(4) 控制者的权利和义务,(5) 子处理方清单,以及 (6) 数据泄露处理程序。该协议必须在你开始录制前签署。

Symphoria 如何解决这一点: Symphoria 提供符合 GDPR 第 28 条的标准 DPA。你可以通过平台界面签署,并且当新增子处理方时,它会自动更新。这使你无需每次都让法律团队介入,也能更容易保持合规。


TL;DR 清单

  • 同意: 记录事先、具体的同意——带有时间戳和退出选项。
  • 存储: 检查数据是否存储在欧盟境内,且不受非欧洲监控立法约束。
  • 训练: 要求明确保证转写文本不会被用于模型训练。
  • 保留: 设置保留期限,并确保删除也会影响 embeddings。
  • 审计: 要求记录谁查看、查询和删除了什么。
  • 导出: 检查你是否可以以开放格式导出所有数据。
  • DPA: 在开始录制前签署数据处理协议。

这对你的组织意味着什么

如果你能回答这七个问题,你已经走在正确的道路上。但请注意:合规不是一次性的清单。GDPR 要求你定期核实自己仍然符合要求(第 24 条:“适当的技术和组织措施”),而 EU AI Act 又为高风险系统增加了一层要求。这意味着:定期审计、为新用例进行 DPIA,以及建立响应访问请求和数据泄露的流程。

想看看这在实践中如何运作?阅读《与 AI 知识库共处的一周:它如何改变服务提供商项目经理的工作》——这是一个叙事案例,我们在其中准确展示这些问题如何在日常实践中出现。

关键经验是:只有在保留客户信任的前提下,AI 知识库才会真正带来生产力提升。而要赢得这种信任,你需要在按下“录制”之前提出并能够回答这些问题。

常见问题

在使用 AI 知识库之前,我是否需要进行 DPIA?
这取决于风险。如果你处理特殊类别的个人数据(GDPR 第 9 条:健康、刑事犯罪数据等),或以大规模方式系统性监控行为,则必须进行 DPIA(GDPR 第 35 条)。对于大多数只录制业务对话的服务提供商而言,DPIA 不是强制性的,但建议进行——尤其是当你的客户来自受监管行业时。
如果发生数据泄露,谁承担责任:我还是 AI 提供商?
作为控制者,你始终承担最终责任(GDPR 第 24 条)。但如果泄露是由处理者(AI 提供商)造成的,你可以追究其责任——前提是你有一份对此作出规定的良好数据处理协议。这就是为什么包含清晰数据泄露程序的 DPA 至关重要。
如果是内部会议,我可以在未经同意的情况下录制吗?
这取决于合法依据。对于内部会议,你有时可以依赖合法利益(GDPR 第 6(1)(f) 条),但你必须能够证明该利益高于相关个人的隐私利益。在实践中,内部也征求同意更安全——尤其是当录音会被 AI 索引时。
如果客户事后撤回同意怎么办?
那么你必须删除该录音,除非你有其他合法依据(例如合同必要性)。GDPR 要求撤回同意应当与给予同意一样容易(第 7(3) 条)。这意味着:你的平台中应有一个允许客户撤回同意的按钮,并有一个流程确保录音在合理期限内删除(通常为 30 天)。
我可以与第三方共享转写文本吗(例如参与项目的自由职业者)?
只有在这属于已给予同意的目的范围内,并且该第三方也受数据处理协议约束时才可以。这意味着:如果你聘请需要访问知识库的自由职业者,该自由职业者必须签署 NDA 和子处理方条款。
EU AI Act 怎么看——AI 知识库是否属于“高风险”?
大概率不是。EU AI Act 将高风险 AI 定义为用于关键领域的系统(例如招聘、信用评分、执法)。仅用于内部项目文档的 AI 知识库通常不属于该类别。但如果你使用 AI 对个人作出决策(例如基于录音进行绩效评估),它就可能变成高风险。

来源与进一步阅读

  1. Algemene Verordening Gegevensbescherming (AVG) — Volledige tekst
  2. EU AI Act — Verordening (EU) 2024/1689
  3. EDPB Guidelines 05/2020 on consent under Regulation 2016/679
  4. Autoriteit Persoonsgegevens — Toestemming vragen
  5. Schrems II: CJEU judgment C-311/18 (Data Protection Commissioner v Facebook Ireland and Maximillian Schrems)
  6. CNIL — Transferts de données hors UE
关于作者
The Wux Webtools Team

最后更新:

继续阅读