AI জ্ঞানভাণ্ডার ও গোপনীয়তা: ক্লায়েন্টের কথোপকথন রেকর্ড করার আগে প্রতিটি সেবা প্রদানকারীর যে ৭টি প্রশ্ন করা উচিত
ক্লায়েন্টের কথোপকথন রেকর্ড ও ইনডেক্স করতে পারে এমন AI অত্যন্ত শক্তিশালী—তবে কেবল তখনই, যখন আপনি ঠিক জানেন কে সম্মতি দিচ্ছেন, ডেটা কোথায় সংরক্ষিত হচ্ছে, এবং আপনি কীভাবে আবার বেরিয়ে আসতে পারবেন
সুচিপত্র
- কেন এই নিবন্ধ
- 1. রেকর্ডিংয়ের সম্মতি কে দেবে—এবং আপনি সেটি কীভাবে নথিভুক্ত করবেন?
- 2. ডেটা শারীরিকভাবে কোথায় সংরক্ষিত, এবং কোন আইন প্রযোজ্য?
- 3. কোন model transcripts প্রক্রিয়াকরণ করে, এবং সেগুলো training-এ ব্যবহৃত হয় কি?
- 4. আপনি recordings এবং embeddings কতদিন রাখেন, এবং সেগুলো কে delete করতে পারে?
- 5. কী audit logs পাওয়া যায়—একজন client পরে কি দেখতে পারবেন "তার" কথোপকথনের কী হয়েছে?
- 6. exit strategy কী? (আপনি কি আপনার knowledge base open format-এ export করতে পারবেন?)
- 7. processor কে, controller কে, এবং তা কি data processing agreement-এ নথিভুক্ত?
- TL;DR checklist
- আপনার প্রতিষ্ঠানের জন্য এর অর্থ কী
কেন এই নিবন্ধ
ক্লায়েন্টের কথোপকথন রেকর্ড, ট্রান্সক্রাইব এবং অনুসন্ধানযোগ্য করে এমন AI জ্ঞানভাণ্ডার সেবা প্রদানকারীদের জন্য উৎপাদনশীলতার বড় উন্নতি। আমরা আগে লিখেছিলাম কীভাবে প্রতি প্রকল্পে AI জ্ঞানভাণ্ডার শেষ পর্যন্ত আপনার কোম্পানির ভেতর থেকেই স্মার্ট হয়ে ওঠে—কিন্তু আপনি যখনই ভয়েস, ভিডিও বা চ্যাট ধারণ করা শুরু করেন, আলোচনা "উপকারী টুল" থেকে "আইনি মূল্যায়ন"-এ সরে যায়।
এই নিবন্ধটি সাতটি প্রশ্নের একটি চেকলিস্ট, যেগুলোর উত্তর আপনার জানা থাকতে হবে Symphoria (Wux Webtools-এর একটি পার্টনার, এবং আমরা নিজেরাও যে প্ল্যাটফর্ম ব্যবহার করি) বা কোনো বিকল্প টুল চালু করার আগে। প্রশ্নগুলো GDPR, EU AI Act, EDPB নির্দেশিকা, এবং ডাচ সেবা প্রদানকারীদের দৈনন্দিন অভিজ্ঞতার ওপর ভিত্তি করে তৈরি—যারা কমপ্লায়েন্স বজায় রাখতে চান, কিন্তু কমপ্লায়েন্সের কারণে কাজ থেমে যাক তা চান না।
প্রেক্ষাপট: আপনি একজন সেবা প্রদানকারী—কনসালটেন্সি, ডেভেলপার, মার্কেটিং এজেন্সি, অ্যাকাউন্ট্যান্ট—যিনি ক্লায়েন্টদের এমন প্রকল্পে সহায়তা করছেন যা কয়েক মাস ধরে চলে এবং ডজনখানেক কথোপকথন তৈরি করে। আপনি চান AI যেন এসব কথোপকথনের সারাংশ করে, অ্যাকশন আইটেম বের করে, এবং "গত সপ্তাহে বাজেট সম্পর্কে ক্লায়েন্ট কী বলেছিলেন?"—এর মতো প্রশ্নের উত্তর দেয়। এটি সম্ভব। কিন্তু এই সাতটি উত্তরের বাইরে নয়।
1. রেকর্ডিংয়ের সম্মতি কে দেবে—এবং আপনি সেটি কীভাবে নথিভুক্ত করবেন?
GDPR অনুযায়ী ব্যক্তিগত ডেটার প্রতিটি প্রক্রিয়াকরণের জন্য একটি বৈধ ভিত্তি প্রয়োজন (Art. 6)। কথোপকথন রেকর্ডিংয়ের ক্ষেত্রে সাধারণত আপনার সম্মতি (Art. 6(1)(a)) অথবা বৈধ স্বার্থ (Art. 6(1)(f)) প্রয়োজন হয়। সম্মতি হতে হবে আগাম, নির্দিষ্ট, অবহিত, এবং স্বেচ্ছায় প্রদত্ত (Art. 7)। এর অর্থ: আগে থেকে টিক দেওয়া বক্স নয়, শর্তাবলির মধ্যে লুকানো ধারা নয়, এবং অবশ্যই "আপনি আপত্তি না করলে আমরা রেকর্ড করি" নয়।
আপনি যা দেখতে চান: প্রথম কথোপকথন রেকর্ড হওয়ার আগে একটি স্পষ্ট opt-in মুহূর্ত। এটি আপনার প্রকল্প onboarding-এ একটি checkbox হতে পারে ("প্রকল্প ডকুমেন্টেশন ও AI সহায়তার উদ্দেশ্যে মিটিং রেকর্ডিংয়ে আমি সম্মত"), কলের শুরুতে মৌখিক নিশ্চিতকরণ হতে পারে ("এই কলটি আমাদের অভ্যন্তরীণ জ্ঞানভাণ্ডারের জন্য রেকর্ড করা হচ্ছে—আপনি কি সম্মত?"), অথবা আলাদা সম্মতি ইমেইল হতে পারে। সম্মতি লগ করতে হবে: কে, কখন, কোন উদ্দেশ্যে, এবং কোন ভাষায় সম্মতি দিয়েছেন।
Symphoria কীভাবে এটি সমাধান করে: Symphoria প্রতি প্রকল্পে একটি consent layer দেয়। রেকর্ডিং শুরু হওয়ার আগে সিস্টেমটি সব অংশগ্রহণকারীর কাছে স্পষ্টভাবে সম্মতি চায়। সেই সম্মতি timestamp এবং IP address সহ সংরক্ষিত হয়, এবং প্রতি প্রকল্পে প্রত্যাহার করা যায়। এতে Art. 7(3) GDPR ("সম্মতি দেওয়া যত সহজ, প্রত্যাহার করাও তত সহজ হতে হবে") মেনে চলা সহজ হয়।
2. ডেটা শারীরিকভাবে কোথায় সংরক্ষিত, এবং কোন আইন প্রযোজ্য?
নীতিগতভাবে, GDPR যথাযথ সুরক্ষা ব্যবস্থা ছাড়া EEA-এর বাইরে ব্যক্তিগত ডেটা স্থানান্তর নিষিদ্ধ করে (Arts. 44-50)। Schrems II রায়ের (2020) পর, Standard Contractual Clauses (SCCs) আর যথেষ্ট নয়, যদি গ্রহণকারী পক্ষ US-এর FISA 702-এর মতো নজরদারি আইনের আওতাধীন হয়। EU AI Act (2024) আরেকটি স্তর যোগ করে: high-risk AI systems-কে transparency এবং audit requirements পূরণ করতে হয়, যা ডেটা EU-এর বাইরে সংরক্ষিত হলে কার্যকর করা কঠিন।
আপনি যা দেখতে চান: ডেটা শারীরিকভাবে কোথায় সংরক্ষিত (কোন data center, কোন দেশ), কোন subprocessors-এর access আছে, এবং সেসব পক্ষ non-European surveillance legislation-এর অধীন কি না—এসব বিষয়ে স্পষ্ট বক্তব্য। আদর্শভাবে: EU-এর মধ্যে storage, এমন provider-এর সঙ্গে যার US parent company নেই, অথবা যে স্পষ্টভাবে "EU-only" mode দেয়।
Symphoria কীভাবে এটি সমাধান করে: Symphoria সম্পূর্ণভাবে European infrastructure-এ চলে (AWS eu-west-1, Frankfurt) এবং transcripts সংরক্ষণ বা প্রক্রিয়াকরণের জন্য US subprocessors ব্যবহার করে না। এতে জটিল impact assessments ছাড়াই Schrems II মেনে চলা সহজ হয়।
3. কোন model transcripts প্রক্রিয়াকরণ করে, এবং সেগুলো training-এ ব্যবহৃত হয় কি?
বেশিরভাগ AI knowledge bases transcripts প্রক্রিয়াকরণের জন্য একটি external LLM (OpenAI, Anthropic, Google) ব্যবহার করে। এতে দুটি প্রশ্ন ওঠে: (1) transcripts কি model train করার জন্য ব্যবহৃত হয়? এবং (2) prompts ও responses-এ কার access আছে? OpenAI-এর API terms মার্চ 2023 থেকে বলে আসছে যে API-এর মাধ্যমে পাঠানো data training-এর জন্য ব্যবহৃত হয় না—যদি না আপনি আলাদা program-এর মাধ্যমে স্পষ্টভাবে opt in করেন। কিন্তু এই নিশ্চয়তা সব providers-এর ক্ষেত্রে প্রযোজ্য নয়, এবং free বা "research" access-এর ক্ষেত্রে তো নয়ই।
আপনি যা দেখতে চান: transcripts model training-এর জন্য ব্যবহার করা হবে না—এমন স্পষ্ট বক্তব্য, এবং processing-এর পর সেগুলো আর LLM provider-এর কাছে accessible থাকবে না। এটি শুধু FAQ-তে নয়, data processing agreement-এ অন্তর্ভুক্ত থাকতে হবে। অতিরিক্ত সুবিধা: platform এমন model ব্যবহার করে যা আপনি নিজে host করতে পারেন (যেমন Llama, Mistral) অথবা strict no-training clause সহ European provider ব্যবহার করে।
Symphoria কীভাবে এটি সমাধান করে: Symphoria OpenAI-এর API ব্যবহার করে, একটি Business Associate Agreement (BAA) এবং no-training clause সহ। Transcripts API-এর মাধ্যমে process করা হয়, কিন্তু OpenAI সেগুলো store করে না এবং future model versions-এ অন্তর্ভুক্ত করে না। এটি subprocessor list-এ স্পষ্টভাবে বলা আছে।
4. আপনি recordings এবং embeddings কতদিন রাখেন, এবং সেগুলো কে delete করতে পারে?
GDPR অনুযায়ী, ব্যক্তিগত ডেটা যে উদ্দেশ্যে সংগ্রহ করা হয়েছে তার জন্য যতদিন প্রয়োজন তার বেশি রাখা যাবে না (Art. 5(1)(e): storage limitation)। AI knowledge base-এর ক্ষেত্রে এর অর্থ, ছয় মাস আগের কোনো recording এখনও কেন relevant—তা আপনাকে ব্যাখ্যা করতে পারতে হবে, এবং পুরনো data delete করার process থাকতে হবে। এটি derived data-র ক্ষেত্রেও প্রযোজ্য: embeddings (text-এর vector representations) যদি কোনো ব্যক্তির সঙ্গে trace করা যায়, তবে সেগুলো personal data।
আপনি যা দেখতে চান: প্রতি project-এ configurable retention period (যেমন "12 মাস পরে recordings স্বয়ংক্রিয়ভাবে delete করুন"), project manager-কে manualভাবে recording delete করতে দেয় এমন button, এবং deletion embeddings ও indexes-কেও প্রভাবিত করে—শুধু audio file নয়—এমন নিশ্চয়তা। আদর্শভাবে: একটি audit log, যেখানে দেখায় কখন কিছু delete করা হয়েছে এবং কার দ্বারা।
Symphoria কীভাবে এটি সমাধান করে: Symphoria প্রতি project-এ "retention policy" দেয়। আপনি recordings X মাস পরে স্বয়ংক্রিয়ভাবে delete হওয়ার জন্য configure করতে পারেন, transcripts এবং embeddings সহ। Project interface-এর মাধ্যমে manual deletion সম্ভব, এবং প্রতিটি deletion audit trail-এ log করা হয়।
5. কী audit logs পাওয়া যায়—একজন client পরে কি দেখতে পারবেন "তার" কথোপকথনের কী হয়েছে?
Transparency GDPR-এর একটি মূলনীতি (Art. 5(1)(a))। এর অর্থ, আপনি কারও data নিয়ে কী করেছেন তা ব্যাখ্যা করতে সক্ষম হতে হবে—ঘটনার পরেও। AI knowledge base-এর ক্ষেত্রে এর অর্থ, কোন recordings করা হয়েছে, কে সেগুলো দেখেছে, কোন queries চালানো হয়েছে, এবং data export বা delete করা হয়েছে কি না—এসব দেখাতে পারতে হবে। Audit logs না থাকলে আপনি এসব প্রশ্নের উত্তর দিতে পারবেন না, এবং data breach বা complaint হলে fines-এর ঝুঁকি তৈরি হয়।
আপনি যা দেখতে চান: প্রতি project-এ একটি audit log যা অন্তত track করে: (1) কে recording শুরু করেছে, (2) কে transcript দেখেছে, (3) knowledge base-এর বিরুদ্ধে কোন queries চালানো হয়েছে, (4) data export করা হয়েছে কি না, এবং (5) data delete করা হয়েছে কি না। সেই log searchable হতে হবে এবং অন্তত 12 মাস ধরে রাখতে হবে (regulated sector-এ কাজ করলে আরও বেশি সময়)।
Symphoria কীভাবে এটি সমাধান করে: Symphoria project level-এ সব actions log করে: recordings, views, queries, exports, এবং deletes। এই logs project owner-এর accessযোগ্য এবং CSV হিসেবে export করা যায়। এতে access request (Art. 15 GDPR) মেনে চলা বা incident তদন্ত করা সহজ হয়।
6. exit strategy কী? (আপনি কি আপনার knowledge base open format-এ export করতে পারবেন?)
Vendor lock-in প্রতিটি SaaS tool-এর ঝুঁকি, কিন্তু AI knowledge base-এর ক্ষেত্রে এটি বিশেষভাবে কষ্টকর: আপনি মাসের পর মাসের conversations, transcripts, এবং metadata সংগ্রহ করেছেন, আর export করতে না পারলে সেই knowledge হারিয়ে যায়। GDPR আপনাকে data portability-এর অধিকার দেয় (Art. 20), কিন্তু তা শুধু আপনি নিজে যে data দিয়েছেন তার ক্ষেত্রে প্রযোজ্য—embeddings বা summaries-এর মতো derived data-র ক্ষেত্রে নয়। তবুও, অন্য provider-এ import করা যায় এমন format-এ সবকিছু export করার সুযোগ দাবি করা বুদ্ধিমানের কাজ।
আপনি যা দেখতে চান: একটি export button যা আপনাকে অন্তত দেয়: (1) সব audio বা video files, (2) plain text বা JSON-এ সব transcripts, (3) সব metadata (timestamps, participants, tags), এবং (4) আদর্শভাবে Parquet বা JSONL-এর মতো open format-এ embeddings-ও। অতিরিক্ত সুবিধা: export automated এবং scheduled করা যায় (যেমন আপনার নিজের S3 bucket-এ weekly backup)।
7. processor কে, controller কে, এবং তা কি data processing agreement-এ নথিভুক্ত?
GDPR controller (যে পক্ষ ব্যক্তিগত ডেটা কেন ও কীভাবে প্রক্রিয়াকরণ হবে তা নির্ধারণ করে) এবং processor (যে পক্ষ controller-এর behalf-এ data process করে)-এর মধ্যে পার্থক্য করে। একজন service provider হিসেবে আপনি সাধারণত controller, আর AI knowledge base হলো processor। এর অর্থ, আপনার একটি data processing agreement (Art. 28 GDPR) দরকার, যেখানে processor কী করতে পারবে, কতদিনের জন্য, কোন subprocessors সহ, এবং data breach হলে কী হবে—এসব নির্ভুলভাবে উল্লেখ থাকবে।
আপনি যা দেখতে চান: Art. 28(3) GDPR মেনে চলা একটি Data Processing Agreement (DPA)। এতে অন্তত থাকতে হবে: (1) processing-এর subject matter এবং duration, (2) processing-এর nature এবং purpose, (3) personal data-র type এবং data subjects-এর categories, (4) controller-এর rights এবং obligations, (5) subprocessors-এর list, এবং (6) data breaches-এর procedure। Recording শুরু করার আগে agreement-টি sign করতে হবে।
Symphoria কীভাবে এটি সমাধান করে: Symphoria Art. 28 GDPR মেনে চলা একটি standard DPA দেয়। আপনি platform interface-এর মাধ্যমে এটি sign করতে পারেন, এবং নতুন subprocessor যোগ হলে এটি automatically updated হয়। এতে প্রতিবার legal team জড়িত না করেও compliant থাকা সহজ হয়।
TL;DR checklist
- Consent: আগাম, নির্দিষ্ট consent record করুন—timestamp এবং opt-out option সহ।
- Storage: data EU-এর মধ্যে stored কি না এবং non-European surveillance legislation-এর অধীন নয় কি না—পরীক্ষা করুন।
- Training: transcripts model training-এর জন্য ব্যবহৃত হবে না—এমন explicit guarantee দাবি করুন।
- Retention: retention period নির্ধারণ করুন এবং deletion embeddings-কেও প্রভাবিত করে তা নিশ্চিত করুন।
- Audit: কে কী viewed, queried, এবং deleted করেছে—তার logs দাবি করুন।
- Export: আপনি সব data open format-এ export করতে পারবেন কি না পরীক্ষা করুন।
- DPA: recording শুরু করার আগে একটি data processing agreement sign করুন।
আপনার প্রতিষ্ঠানের জন্য এর অর্থ কী
আপনি যদি এই সাতটি প্রশ্নের উত্তর দিতে পারেন, তাহলে আপনি অনেকটাই সঠিক পথে আছেন। তবে মনে রাখবেন: compliance একবারের checklist নয়। GDPR অনুযায়ী আপনাকে নিয়মিত verify করতে হবে যে আপনি এখনও requirements পূরণ করছেন (Art. 24: "appropriate technical and organisational measures"), এবং EU AI Act high-risk systems-এর জন্য আরেকটি স্তর যোগ করে। এর অর্থ: periodic audits, নতুন use cases-এর জন্য DPIAs, এবং access requests ও data breaches-এ সাড়া দেওয়ার process।
এটি বাস্তবে কীভাবে কাজ করে দেখতে চান? AI knowledge base-এর সঙ্গে এক সপ্তাহ পড়ুন: কীভাবে এটি service provider-এর project manager-এর কাজ বদলে দেয়—একটি narrative case, যেখানে আমরা দেখাই day-to-day practice-এ এই প্রশ্নগুলো ঠিক কীভাবে উঠে আসে।
মূল শিক্ষা: AI knowledge base কেবল তখনই productivity gain হয়, যখন আপনি আপনার clients-এর trust বজায় রাখেন। আর সেই trust অর্জন করতে হয় "record" চাপার আগে এসব প্রশ্ন করে—এবং উত্তর দিতে সক্ষম হয়ে।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
AI knowledge base ব্যবহার করার আগে কি আমাকে DPIA করতে হবে?
Data breach হলে দায়ী কে: আমি নাকি AI provider?
Internal meetings হলে consent ছাড়া কি আমি recordings করতে পারি?
কোনো client পরে consent withdraw করলে কী হবে?
আমি কি third parties-এর সঙ্গে transcripts share করতে পারি (যেমন project-এ কাজ করা freelancers)?
EU AI Act সম্পর্কে কী—AI knowledge base কি 'high-risk'-এর মধ্যে পড়ে?
স्रोत ও আরও পড়া
- Algemene Verordening Gegevensbescherming (AVG) — Volledige tekst
- EU AI Act — Verordening (EU) 2024/1689
- EDPB Guidelines 05/2020 on consent under Regulation 2016/679
- Autoriteit Persoonsgegevens — Toestemming vragen
- Schrems II: CJEU judgment C-311/18 (Data Protection Commissioner v Facebook Ireland and Maximillian Schrems)
- CNIL — Transferts de données hors UE