「會議錄音用 AI 轉成文字後,內容會不會外洩?」

在先前的文章中,我整理了從個人資訊、敏感資訊、點子等資料的「種類」來看外洩方式的內容(哪些資訊可以丟給 AI)。但對於照片📷、錄音🎙、PDF📄、程式碼💻、按讚👍等從資料的「形式」來看的風險,還還沒有答案。

要讀規約的哪裡才找得到答案。 我按形式逐一統計了。


1. 哪些產品在寫哪些形式

AI 產品 14 件 × 6 種形式(按讚・檔案・圖片・音訊・程式碼・中繼資料)的記載有無

在各種形式中,記載最多的是 Gemini,在 6 種形式裡有 4 種有寫。 而且不同版本(個人版或 Workspace 版)寫法還是相反的 — 個人版表示會把音訊和螢幕共享用於學習,而 Workspace 版則表示不會使用上傳的檔案。

不過整體來看,84 格裡只有 23 格有填。 空白不代表「不使用」,而是對那種形式完全沒有寫

這張表沒列出的產品有 22 件。 這些 22 件不是省略記載,而是在規約上沒有依資料形式做區分(把所有形式一律對待)的產品。對於沒有按形式區分的產品,自然可以理解為與文字相同的方針直接適用

2. 錄音、照片、PDF,和文字是同樣的處理嗎

依形式排列,寫明會用於學習的產品、附條件的產品、不會使用的產品三欄表

要看產品而定。針對同一種形式,有些產品寫「會用於學習」,也有些寫「不會使用」。 從寫出來的 14 件裡,按形式整理如下。

形式 有寫的例子(含版本)音訊・錄音 🎙Gemini(個人版)明確寫了會把音訊和螢幕共享用於包含訓練的改進Genspark 表示不會保存也不會提供原始音訊檔案的存取(只提供文字轉錄和會議紀錄)/Manus 明確寫了音訊・語音片段是輸入之一,並會從中導出資訊,但沒有寫是否會用於學習**圖片・表單 📷DX Suite 寫到在學習前會把姓名與電話號碼遮蔽,並轉換成不可逆格式,同頁也寫了「不保證完全精準」/Smart OCR從表單圖片中切出的文字影像拿去學習寫成一項功能上傳的檔案 📄NotebookLM 寫明上傳的檔案不會用於人工審查或改進但在送出意見回饋時除外/Gemini 也對Workspace 版寫了相同內容(與個人版不同)/Felo 則寫了企業版在有明示同意之外,不會拿去做學習**程式碼 💻Cursor 明確寫出程式碼庫、提示詞、編輯器操作、程式碼片段GitHub Copilot 明確寫出輸入、輸出、程式碼片段、相關上下文**中繼資料LINE WORKS OCR 另外寫了會自動產生並保存存取紀錄(IP 位址、瀏覽器種類、語言、時間戳)**

錄音的處理方式,正如上表所示分成 3 種。 也就是說,對「AI 會怎麼處理錄音」這個問題,只要不先決定產品,就沒有答案

3. 只靠產品名稱能不能說明

GitHub Copilot 與 Gemini 的個人版和企業版在是否用於學習上結論相反的表格

不能。 同一個產品名稱,因為版本(個人版或企業版)不同,會出現「會用」和「不會用」互換的例子有 2 個。

產品 個人向版本 企業向版本GitHub Copilot個人向(Free・Pro・Pro+)可能會把輸入、輸出、程式碼片段用於訓練或改進(可選擇退出)GitHub 不會使用 Business 與 Enterprise 的任何資料來訓練模型**Gemini個人版會把音訊和螢幕共享用於包含訓練的改進Workspace 版不會讓上傳的檔案被人工審查,也不會在未經許可的情況下用於生成式 AI 模型訓練**

所以「Gemini 會把音訊拿去學習」也好,「Gemini 不會把檔案拿去學習」也好,如果不寫清楚是哪個版本,兩者都不正確

4. 為什麼「按讚」和資訊外洩有關

同樣是「按讚」,在不同產品中會變成 3 種意思(不會用於學習・保存你按讚的對話・即使關閉歷史也會保存 72 小時)

因為有 7 件產品明確寫了這點,而且是在各種形式中最多的。 另外,寫法在不同產品之間也互相不一致。

產品 寫了什麼Microsoft 365 Copilot明確寫著這些回饋不會用於基礎模型訓練**Claude**按下 👍/👎 時,會把相關對話當作回饋的一部分保存。而且規約還寫著,即使選擇退出,回饋仍會被用於學習**Gemini**即使關閉對話歷史,也會為了處理回饋而最多保存 72 小時**NotebookLM上傳的檔案不會用於改進,但前提是你沒有提供回饋**Claude Code寫到可以在組織設定中直接不顯示回饋入口

📎 此引用的原文(供應商逐字)與來源・確認日期,請見「錄音・照片・檔案是否與文字同樣處理」
同樣是按一次「👍」,在不同產品裡卻有 3 種不同含義(如上圖與表所示)。

這裡把 Claude 和 NotebookLM 拿來比較,可以看到雖然是不同公司的不同產品,但在同一個位置放了同樣的例外 — 「不使用,但如果送出回饋就另當別論」。例外很常被放在這個位置,也就是這個意思。

5. 「我的資料」只有一種嗎

「我的資料」的 3 種類型(輸入的資訊・回傳的資訊・自動生成的資訊)

有 3 種。混在一起讀,答案就會看錯。

第 3 種「自動生成的資訊」要特別注意。 中繼資料(存取紀錄)是使用者不管有沒有輸入都會自動產生的。因此如果把它和「自己輸入的資訊」放在同一欄,就會誤以為那是自己的輸入。

第 2 種「回傳的資訊」也是一樣。從資料產生語音解說的功能,屬於 AI 生成並播放的內容,這並沒有回答「你輸入的錄音會如何被處理」。

用產品比較表確認

各種形式的記載,要和該產品是否寫明會用於學習一起看。請找出你們公司正在使用的產品。

📊 這張比較表(由各產品調查紀錄機械繪製、可點擊符號查看依據)請見「錄音・照片・檔案是否與文字同樣處理」

調查詳情

編輯部逐一閱讀了 AI 產品 36 件中所蒐集並保存的頁面(各產品的使用條款、隱私權政策、說明文件),只摘錄有明確寫出輸入形式區分的內容。

統計方式

14 件有按形式區分記載,22 件是「有調查但沒有按形式區分」。「省略記載」和「調查後發現沒有依形式區分」是不同的事,所以我們也保留了 22 件的搜尋位置與確認過的 URL 清單

因為一個產品可能會寫到多種形式,按形式加總會超過 14(Gemini 就包含音訊、圖片、檔案、按讚 4 種形式)。

原本有 3 件我們認為佐證稍弱,其中 2 件(Manus、Felo)後來找到了能指出位置的記載,因此改成可直接引用原文的形式。剩下 1 件(Claude Code 的檔案)無法特定到頁面,所以本文與圖中都沒有使用

各產品的逐項紀錄已在 IT 連結地圖 上,附來源 URL 與調查日期公開。

考察 — 明確提到特定形式的企業,往往也會涵蓋全部形式

最初的假設是「只有當那種形式是產品主體時才會寫」。例如影像辨識產品會寫圖片,程式工具會寫程式碼,因為脈絡上看起來就是這樣。

不過 Gemini 不符合這個看法。 雖然它並不是以音訊為主的產品,卻把音訊・圖片・檔案・按讚這 4 種形式全部都明確寫出來。DX Suite 也寫了圖片與檔案這 2 種形式。

與其說是「因為是主體才寫」,不如說「會寫的企業往往會把全部形式都寫出來」也許更接近。 但這只是推測,尚未驗證。14 件的樣本太少,還無法分辨兩種說法。

調查範圍與未調查事項

  • 對象是已調查的 AI 產品 36 件。不是所有 AI 產品的整體分布。
  • 確認時間是 2026-09-14規約與隱私權政策會以月為單位變動。
  • 沒有實際把錄音或圖片丟進去測試行為。 我們只讀了文字記載。
  • 搜尋的是已保存頁面中可讀的文字部分。 對於某些產品來說,提供方頁面的一部分文字若在畫面渲染機制中,重新擷取時可能會增加對象(有 1 件因此無法直接引用原文)。
  • 「沒有按形式區分的 22 件」不代表它們不使用那種形式。 只是代表它們沒有按形式分成不同方針,而是統一寫成一個方針。
  • 沒有處理如何關閉設定,以及關閉後仍會留下什麼。 這部分可見在個人版狀態下防止資訊外洩的 5 個方法

延伸閱讀(編輯部相關文章)

這些都是根據第一手資料調查撰寫的。

各產品的學習利用、保存位置與外帶風險調查,已在 IT 連結地圖AI・自動化工具列表業務系統列表運作狀況)中,逐一附上來源 URL 與調查日期公開。

本文是以 45 個讚、52 個收藏支持的
AI 輸入的資料會被拿去學習嗎 — 34 種產品的規約讀法
為相關主題,進一步深入撰寫的文章。

讀者問卷進行中
如果你希望這個主題再更深入,請幫這篇文章按讚。之後會依照按讚數較多的主題繼續追加調查,結果將在新文章中通知你(追蹤的話也會收到通知)。

【可轉載】關於本文的轉載

本文文字與圖表皆可轉載。圖請不要加工,原樣使用即可。轉載時,請註明來源為 renkeimap.jp 或附上本文連結。不需要事先聯絡。

※ 作者曾任職於日立系 IT 廠商、長照軟體廠商、大學醫院 IT 部門,現已獨立,主要在協助中小企業導入 IT/DX,同時以第一手資料調查業務系統之間的「連結」。文中的「編輯部」指的是作者所屬的 IT 連結地圖編輯部。若發現錯誤,請到 更正窗口(免費、無需帳號)告訴我們。我們也會公開更正紀錄。


原文出處:https://qiita.com/songchong/items/e630bf05f4adf0c16ce5


精選技術文章翻譯,幫助開發者持續吸收新知。

共有 0 則留言


精選技術文章翻譯,幫助開發者持續吸收新知。
🏆 本月排行榜
🥇
站長阿川
📝30   💬1  
444
🥈
我愛JS
3
🥉
NewsData
2
評分標準:發文×10 + 留言×3 + 獲讚×5 + 點讚×1 + 瀏覽數÷10
本數據每小時更新一次
📢 贊助商廣告 · 我要刊登