Pangkalan pengetahuan AI dan kerahsiaan: 7 soalan yang patut ditanya oleh setiap penyedia perkhidmatan sebelum merakam perbualan pelanggan
AI yang merakam dan mengindeks perbualan pelanggan amat berkuasa—tetapi hanya jika anda tahu dengan tepat siapa yang memberi persetujuan, di mana data disimpan, dan bagaimana anda boleh keluar semula
Jadual kandungan
- Mengapa artikel ini
- 1. Siapa yang memberi persetujuan untuk rakaman—dan bagaimana anda merekodkannya?
- 2. Di manakah data disimpan secara fizikal, dan undang-undang manakah yang terpakai?
- 3. Model manakah yang memproses transkrip, dan adakah transkrip digunakan untuk latihan?
- 4. Berapa lama anda menyimpan rakaman dan embeddings, dan siapa yang boleh memadamkannya?
- 5. Log audit apakah yang tersedia—bolehkah pelanggan kemudian melihat apa yang berlaku kepada perbualan "mereka"?
- 6. Apakah strategi keluar? (Bolehkah anda mengeksport pangkalan pengetahuan anda dalam format terbuka?)
- 7. Siapakah pemproses, siapakah pengawal, dan adakah perkara itu didokumenkan dalam perjanjian pemprosesan data?
- Senarai semak TL;DR
- Apa maknanya untuk organisasi anda
Mengapa artikel ini
Pangkalan pengetahuan AI yang merakam, menyalin, dan menjadikan perbualan pelanggan boleh dicari ialah peningkatan produktiviti yang besar untuk penyedia perkhidmatan. Kami sebelum ini menulis tentang bagaimana pangkalan pengetahuan AI mengikut projek akhirnya menjadi pintar daripada syarikat anda—tetapi sebaik sahaja anda mula menangkap suara, video, atau sembang, perbualan beralih daripada "alat berguna" kepada "penilaian undang-undang".
Artikel ini ialah senarai semak tujuh soalan yang perlu anda mampu jawab sebelum melaksanakan alat seperti Symphoria (rakan kongsi Wux Webtools, dan platform yang kami gunakan sendiri) atau alternatif lain. Soalan-soalan ini berdasarkan GDPR, EU AI Act, garis panduan EDPB, dan amalan harian penyedia perkhidmatan Belanda yang mahu kekal patuh tanpa pematuhan menghentikan kerja.
Konteksnya: anda ialah penyedia perkhidmatan—perundingan, pembangun, agensi pemasaran, akauntan—yang membantu pelanggan dengan projek yang berlangsung berbulan-bulan dan menghasilkan puluhan perbualan. Anda mahu AI meringkaskan perbualan tersebut, mengekstrak item tindakan, dan menjawab soalan seperti "apa yang pelanggan katakan minggu lepas tentang bajet?". Itu boleh dilakukan. Tetapi bukan tanpa tujuh jawapan ini.
1. Siapa yang memberi persetujuan untuk rakaman—dan bagaimana anda merekodkannya?
GDPR memerlukan asas undang-undang untuk setiap pemprosesan data peribadi (Art. 6). Untuk rakaman perbualan, anda biasanya memerlukan persetujuan (Art. 6(1)(a)) atau kepentingan sah (Art. 6(1)(f)). Persetujuan mesti diberikan terlebih dahulu, khusus, bermaklumat, dan secara bebas (Art. 7). Ini bermakna: tiada kotak yang telah ditanda terlebih dahulu, tiada klausa tersembunyi dalam terma dan syarat, dan sudah tentu tiada "kami merakam melainkan anda membantah".
Apa yang anda mahu lihat: Detik opt-in yang jelas sebelum perbualan pertama dirakam. Ini boleh berupa kotak semak dalam onboarding projek anda ("Saya bersetuju dengan rakaman mesyuarat bagi tujuan dokumentasi projek dan sokongan AI"), pengesahan lisan pada permulaan panggilan ("Panggilan ini dirakam untuk pangkalan pengetahuan dalaman kami—adakah anda bersetuju?"), atau e-mel persetujuan berasingan. Persetujuan mesti dilog: siapa, bila, untuk tujuan apa, dan dengan kata-kata yang mana.
Bagaimana Symphoria menyelesaikannya: Symphoria menawarkan lapisan persetujuan mengikut projek. Sebelum rakaman bermula, sistem secara jelas meminta persetujuan semua peserta. Persetujuan itu disimpan dengan cap masa dan alamat IP, dan boleh ditarik balik mengikut projek. Ini memudahkan pematuhan kepada Art. 7(3) GDPR ("menarik balik persetujuan hendaklah semudah memberi persetujuan").
2. Di manakah data disimpan secara fizikal, dan undang-undang manakah yang terpakai?
Pada prinsipnya, GDPR melarang pemindahan data peribadi ke negara di luar EEA tanpa perlindungan yang sesuai (Art. 44-50). Selepas penghakiman Schrems II (2020), Standard Contractual Clauses (SCCs) tidak lagi mencukupi jika pihak penerima tertakluk kepada undang-undang pengawasan seperti FISA 702 di AS. EU AI Act (2024) menambah satu lagi lapisan: sistem AI berisiko tinggi mesti memenuhi keperluan ketelusan dan audit yang sukar dikuatkuasakan jika data disimpan di luar EU.
Apa yang anda mahu lihat: Pernyataan yang jelas tentang di mana data disimpan secara fizikal (pusat data mana, negara mana), subpemproses mana yang mempunyai akses, dan sama ada pihak-pihak tersebut tertakluk kepada undang-undang pengawasan bukan Eropah. Sebaiknya: penyimpanan dalam EU, dengan penyedia yang tidak mempunyai syarikat induk AS atau yang secara jelas menawarkan mod "EU-only".
Bagaimana Symphoria menyelesaikannya: Symphoria beroperasi sepenuhnya pada infrastruktur Eropah (AWS eu-west-1, Frankfurt) dan tidak menggunakan subpemproses AS untuk menyimpan atau memproses transkrip. Ini memudahkan pematuhan kepada Schrems II tanpa penilaian impak yang kompleks.
3. Model manakah yang memproses transkrip, dan adakah transkrip digunakan untuk latihan?
Kebanyakan pangkalan pengetahuan AI menggunakan LLM luaran (OpenAI, Anthropic, Google) untuk memproses transkrip. Ini menimbulkan dua soalan: (1) adakah transkrip digunakan untuk melatih model? dan (2) siapa yang mempunyai akses kepada prompt dan respons? Terma API OpenAI telah menyatakan sejak Mac 2023 bahawa data yang dihantar melalui API tidak digunakan untuk latihan—melainkan anda secara jelas opt in melalui program berasingan. Tetapi jaminan itu tidak terpakai kepada semua penyedia, dan sudah tentu tidak kepada akses percuma atau "research".
Apa yang anda mahu lihat: Pernyataan yang jelas bahawa transkrip tidak digunakan untuk latihan model, dan bahawa selepas pemprosesan, transkrip tidak lagi boleh diakses oleh penyedia LLM. Perkara ini mesti dimasukkan dalam perjanjian pemprosesan data, bukan hanya dalam FAQ. Bonus: platform menggunakan model yang boleh anda hos sendiri (cth. Llama, Mistral) atau penyedia Eropah dengan klausa larangan latihan yang ketat.
Bagaimana Symphoria menyelesaikannya: Symphoria menggunakan API OpenAI dengan Business Associate Agreement (BAA) dan klausa larangan latihan. Transkrip diproses melalui API, tetapi tidak disimpan oleh OpenAI dan tidak dimasukkan dalam versi model akan datang. Perkara ini dinyatakan secara jelas dalam senarai subpemproses.
4. Berapa lama anda menyimpan rakaman dan embeddings, dan siapa yang boleh memadamkannya?
GDPR memerlukan data peribadi tidak disimpan lebih lama daripada yang diperlukan untuk tujuan data itu dikumpulkan (Art. 5(1)(e): had penyimpanan). Untuk pangkalan pengetahuan AI, ini bermakna anda mesti mampu menjelaskan mengapa rakaman dari enam bulan lalu masih relevan, dan anda mesti mempunyai proses untuk memadam data lama. Ini juga terpakai kepada data terbitan: embeddings (perwakilan vektor bagi teks) ialah data peribadi jika ia boleh dijejaki kembali kepada individu.
Apa yang anda mahu lihat: Tempoh penyimpanan yang boleh dikonfigurasi mengikut projek (cth. "padam rakaman secara automatik selepas 12 bulan"), butang yang membolehkan pengurus projek memadam rakaman secara manual, dan jaminan bahawa pemadaman juga melibatkan embeddings dan indeks—bukan hanya fail audio. Sebaiknya: log audit yang menunjukkan bila sesuatu dipadam dan oleh siapa.
Bagaimana Symphoria menyelesaikannya: Symphoria menawarkan "retention policy" mengikut projek. Anda boleh mengkonfigurasi rakaman supaya dipadam secara automatik selepas X bulan, termasuk transkrip dan embeddings. Pemadaman manual boleh dilakukan melalui antara muka projek, dan setiap pemadaman dilog dalam jejak audit.
5. Log audit apakah yang tersedia—bolehkah pelanggan kemudian melihat apa yang berlaku kepada perbualan "mereka"?
Ketelusan ialah prinsip teras GDPR (Art. 5(1)(a)). Ini bermakna anda mesti mampu menjelaskan apa yang telah anda lakukan dengan data seseorang—walaupun selepas kejadian. Untuk pangkalan pengetahuan AI, ini bermakna anda mesti mampu menunjukkan rakaman mana yang dibuat, siapa yang melihatnya, pertanyaan mana yang dijalankan, dan sama ada data dieksport atau dipadam. Tanpa log audit, anda tidak boleh menjawab soalan-soalan itu, dan anda berisiko dikenakan denda sekiranya berlaku pelanggaran data atau aduan.
Apa yang anda mahu lihat: Log audit mengikut projek yang menjejaki sekurang-kurangnya: (1) siapa yang memulakan rakaman, (2) siapa yang melihat transkrip, (3) pertanyaan mana yang dijalankan terhadap pangkalan pengetahuan, (4) sama ada data dieksport, dan (5) sama ada data dipadam. Log itu mesti boleh dicari dan disimpan sekurang-kurangnya 12 bulan (lebih lama jika anda bekerja dalam sektor terkawal).
Bagaimana Symphoria menyelesaikannya: Symphoria melog semua tindakan pada peringkat projek: rakaman, paparan, pertanyaan, eksport, dan pemadaman. Log ini boleh diakses oleh pemilik projek dan boleh dieksport sebagai CSV. Ini memudahkan pematuhan kepada permintaan akses (Art. 15 GDPR) atau penyiasatan insiden.
6. Apakah strategi keluar? (Bolehkah anda mengeksport pangkalan pengetahuan anda dalam format terbuka?)
Vendor lock-in ialah risiko dengan setiap alat SaaS, tetapi dengan pangkalan pengetahuan AI ia amat menyakitkan: anda telah mengumpulkan perbualan, transkrip, dan metadata selama berbulan-bulan, dan jika anda tidak boleh mengeksportnya, anda kehilangan pengetahuan itu. GDPR memberi anda hak kepada kebolehgunaan data merentas platform (Art. 20), tetapi itu hanya terpakai kepada data yang anda berikan sendiri—bukan kepada data terbitan seperti embeddings atau ringkasan. Namun begitu, adalah bijak untuk mensyaratkan bahawa anda boleh mengeksport segala-galanya, dalam format yang boleh anda import ke penyedia lain.
Apa yang anda mahu lihat: Butang eksport yang memberikan anda sekurang-kurangnya: (1) semua fail audio atau video, (2) semua transkrip dalam teks biasa atau JSON, (3) semua metadata (cap masa, peserta, tag), dan (4) sebaiknya juga embeddings dalam format terbuka seperti Parquet atau JSONL. Bonus: eksport diautomasi dan boleh dijadualkan (cth. sandaran mingguan ke bucket S3 anda sendiri).
7. Siapakah pemproses, siapakah pengawal, dan adakah perkara itu didokumenkan dalam perjanjian pemprosesan data?
GDPR membezakan antara pengawal (pihak yang menentukan mengapa dan bagaimana data peribadi diproses) dan pemproses (pihak yang memproses data bagi pihak pengawal). Sebagai penyedia perkhidmatan, anda biasanya ialah pengawal, dan pangkalan pengetahuan AI ialah pemproses. Ini bermakna anda memerlukan perjanjian pemprosesan data (Art. 28 GDPR) yang menetapkan dengan tepat apa yang boleh dilakukan oleh pemproses, untuk berapa lama, dengan subpemproses yang mana, dan apa yang berlaku sekiranya berlaku pelanggaran data.
Apa yang anda mahu lihat: Data Processing Agreement (DPA) yang mematuhi Art. 28(3) GDPR. Ia mesti merangkumi sekurang-kurangnya: (1) perkara pokok dan tempoh pemprosesan, (2) sifat dan tujuan pemprosesan, (3) jenis data peribadi dan kategori subjek data, (4) hak dan kewajipan pengawal, (5) senarai subpemproses, dan (6) prosedur untuk pelanggaran data. Perjanjian itu mesti ditandatangani sebelum anda mula merakam.
Bagaimana Symphoria menyelesaikannya: Symphoria menawarkan DPA standard yang mematuhi Art. 28 GDPR. Anda boleh menandatanganinya melalui antara muka platform, dan ia dikemas kini secara automatik apabila subpemproses baharu ditambah. Ini memudahkan anda kekal patuh tanpa melibatkan pasukan undang-undang setiap kali.
Senarai semak TL;DR
- Persetujuan: Rekod persetujuan awal yang khusus—dengan cap masa dan pilihan opt-out.
- Penyimpanan: Semak sama ada data disimpan dalam EU dan tidak tertakluk kepada undang-undang pengawasan bukan Eropah.
- Latihan: Syaratkan jaminan yang jelas bahawa transkrip tidak digunakan untuk latihan model.
- Penyimpanan data: Tetapkan tempoh penyimpanan dan pastikan pemadaman juga melibatkan embeddings.
- Audit: Syaratkan log tentang siapa yang melihat, membuat pertanyaan, dan memadam apa.
- Eksport: Semak sama ada anda boleh mengeksport semua data dalam format terbuka.
- DPA: Tandatangani perjanjian pemprosesan data sebelum anda mula merakam.
Apa maknanya untuk organisasi anda
Jika anda boleh menjawab tujuh soalan ini, anda sudah berada di landasan yang baik. Tetapi ambil perhatian: pematuhan bukan senarai semak sekali sahaja. GDPR menghendaki anda mengesahkan secara berkala bahawa anda masih memenuhi keperluan (Art. 24: "langkah teknikal dan organisasi yang sesuai"), dan EU AI Act menambah satu lagi lapisan untuk sistem berisiko tinggi. Ini bermakna: audit berkala, DPIA untuk kes penggunaan baharu, dan proses untuk menjawab permintaan akses serta pelanggaran data.
Mahu melihat bagaimana ini berfungsi dalam amalan? Baca seminggu dengan pangkalan pengetahuan AI: bagaimana ia mengubah kerja pengurus projek di penyedia perkhidmatan—satu kes naratif yang menunjukkan dengan tepat bagaimana soalan-soalan ini timbul dalam amalan harian.
Pengajaran utama: pangkalan pengetahuan AI hanya menjadi peningkatan produktiviti jika anda mengekalkan kepercayaan pelanggan anda. Dan anda memperoleh kepercayaan itu dengan bertanya—dan mampu menjawab—soalan-soalan ini sebelum anda menekan "record".
Soalan yang sering ditanya
Adakah saya perlu menjalankan DPIA sebelum menggunakan pangkalan pengetahuan AI?
Siapa yang bertanggungjawab jika berlaku pelanggaran data: saya atau penyedia AI?
Bolehkah saya membuat rakaman tanpa persetujuan jika ia mesyuarat dalaman?
Bagaimana jika pelanggan menarik balik persetujuan selepas itu?
Bolehkah saya berkongsi transkrip dengan pihak ketiga (cth. freelancer yang bekerja pada projek)?
Bagaimana pula dengan EU AI Act—adakah pangkalan pengetahuan AI termasuk dalam kategori 'high-risk'?
Sumber & bacaan lanjut
- Algemene Verordening Gegevensbescherming (AVG) — Volledige tekst
- EU AI Act — Verordening (EU) 2024/1689
- EDPB Guidelines 05/2020 on consent under Regulation 2016/679
- Autoriteit Persoonsgegevens — Toestemming vragen
- Schrems II: CJEU judgment C-311/18 (Data Protection Commissioner v Facebook Ireland and Maximillian Schrems)
- CNIL — Transferts de données hors UE