「把輸入到這個 AI 裡的內容會被看出來嗎」
我想這大概是公司內開始使用 AI 時,最常被問到的問題。回答的人往往會下意識地說「大概法人版就沒問題吧」,我以前也是這樣。因為我對自己只能含糊回答這件事一直很在意,於是我把 AI 聊天、AI 代理、AI-OCR、iPaaS 的 34 項產品,逐一打開使用條款、隱私政策與說明文件,記錄下裡面到底寫了什麼(調查日 2026-08-26。來源 URL 已完整收錄在文末「調查對象的 34 項產品」中)。
以下這張圖是把結論濃縮成一頁的總覽。
- 「會被用於學習」這句話裡,混在一起的是 3 種性質與風險不同的路徑(① 重新訓練/② 會被人看見 👀/③ 會被保存 💽)
- 同樣的產品名稱,個人版與法人版的結論可能相反(34 件裡有 10 件會因合約種類而不同)
- 條款中真的有產品寫到「可能會有人看」
- 而且,最讓人想知道的 「被學習的內容會不會出現在別人的回答裡」,條款幾乎都沒有正面回答(§2 會從公開研究補充說明)
本文整體都是依照這個對應關係來整理:產品 → ① 是否會用於學習 → ② 是否會被人看見 → ③ 會保留多久、留在哪裡 → 學習類型 → 可能會洩漏什麼。風險則以 圓點顏色 統一表示(🔴 會被使用、且會直接看見/🟡 有條件、風險較低但非零/🟢 明確寫明不會使用、因為是彙總所以較不屬於個別資訊外洩/⚪ 未記載)。
圖表只是摘要。精確條件可看 §3 的表格;各產品的原文與來源可從 §5 的清單追溯。
「會被用於學習」這一句裡,混了好幾種不同的事情。先把路徑拆開。
以下本文會以 ① 重新訓練/② 會被人看見 👀/③ 會被保存 💽 這三個編號來說明。只有 ① 才是在講「讓模型記住」,而且裡面又可以再分成 3 個階段。下面依序說明。
前置訓練 📖 — 是 AI 模型剛開始建立時,讓它大量閱讀網路上的公開文件,藉此學會世界上語言的用法的階段。沒有任何一份條款寫到你的對話會進入這個階段。當條款寫「會用於學習」時,通常指的是接下來這兩個階段。
追加訓練 ➕ — 是把使用者輸入或修正結果,額外讓模型學會的訓練。重點在於,輸入不是原封不動地保存,而是轉換成模型的「權重(參數)」這種數值集合後被納入。這不是把對話放進資料庫、之後再查詢取出的機制。這一點連供應商自己的說法也有寫 — DX Suite 說明會先把資料轉成不可逆的「參數」再進行學習。實例包括:DX Suite(連使用者的確認與修正結果也會拿去學習)、Smart OCR(雲端版會作為教師資料二次利用)、CrewAI(明示授權可將輸入與輸出用於訓練)。
偏好調整 👍 — 是依照人工評價,學習回答「好不好」的最後調整階段。很多系統會把你在畫面上按 👍/👎 傳送的評價,以及當時的對話內容納入對象。實例包括:Claude(送出評價的對話最長保留 5 年)、NotebookLM(只有在送出評價時,內容才會被確認)。
② 會被人看見 👀(人工審查) — 這不是學習。這是供應商員工或受託業者為了品質確認等目的,用眼睛直接看內容。如果你擔心「會不會被看到」,最接近這個擔心的就是這條路徑。實例:Gemini(個人版在啟用活動記錄時,明示會有人審查)、Antigravity(明示員工與外包承攬方可能會查看)。反過來,NotebookLM 的 Workspace 版明確寫著「不會交由人工審查員查看」——有寫的產品,真的都有寫。
③ 會被保存 💽(保存與揭露) — 這是跟是否用於學習分開的事情,也就是資料會被留下來,或可能被提供給第三方。即使你關掉學習,保存仍然會繼續。實例:Perplexity(明示即使停止學習用途,停止前取得的部分也無法刪除或移除)、Manus(記載第三方 AI 供應商可能保有使用與揭露內容的權利)、Claude Code(若設定為會用於學習則保留 5 年;若設定為不使用則 30 天——③ 會隨 ① 的設定一起變動,是一個例子)。
總結來說 — ① 與 ②③ 不會連動。就算產品寫著「不會用於學習」,資料仍然會被保存。而且,34 件條款中沒有任何一件精確指出會進入哪一個階段的學習(大多只寫「用於學習/改善」而已。上面提到的產品名稱,是能從條文讀出階段差異的實例)。
依照你輸入資料的種類,我把 §1 的路徑整理成一頁,看看哪些東西可能會外洩。
個人資訊(姓名、聯絡方式) — 從訓練資料中復原出包含姓名與聯絡方式的字串,公開研究已經證實做得到。供應商層面的對策通常是「在學習前先遮蔽」,但在 34 件產品裡,明確寫到這點的只有 DX Suite 與 DeepSeek 兩件(DeepSeek 寫的是「以嚴格匿名化處理、並以前述不可逆性為前提」使用)。CrewAI、Dify、Manus 提到的「匿名化」是建立彙總資料的作法,與學習前先移除資料不同。其餘 29 件對這個問題完全沒有說明——這不是說它們「沒有做防護」,而是公開資訊就是這個狀態的紀錄。
敏感資訊(健康、人事評價、信用評估等) — 在 34 件條款裡,我沒有找到在學習場景中特別處理敏感資訊的條文(大多是把它包含在個人資訊框架中來寫)。外洩機制與個人資訊相同 — 在 ① 的路徑中,反覆出現的字串較容易被重現;在 ② 的路徑中,內容會直接被看見。
關鍵字/專有名詞(客戶名稱、交易對象、尚未公開的產品名) — 這類一次性出現的專有名詞,直接原樣跑出來的機率偏低,但重複輸入的名稱越多,模型越容易記住,這是後述實證研究顯示的趨勢。在 ②③ 的路徑中,當然就是原封不動保留。
想法 — 透過 ① 路徑(被納入權重並出現在他人輸出)時,因為是大量資料的統計結果,所以單一想法原封不動出現在別人畫面上的可能性偏低。現實中更接近「會被看見」的,其實是 ② 與 ③——被人看見、被保存後揭露、以及之後即使停止也不會把過去的部分抹掉。
內部機密(程式碼、策略文件) — 後述研究不區分文字與程式碼。在訓練資料中反覆出現的字串,越容易被重現,這是同一套實驗結果適用的地方。即使你貼上去的內容是一段只出現一次的文字,要它一字不漏地原樣跑出來的機率偏低,也沒有任何保證,而且 ②③ 的路徑仍然直接生效。
圖表中 ① 欄位的判斷基礎,來自以下公開研究。
那條款本身又是怎麼寫的呢?
在 34 項產品的條款中,我沒有找到任何一條正面說明「被學習的內容會不會出現在其他使用者的回答裡」。
條款所寫的多半只到更前面一步——像是「會先把可識別字串遮蔽後再學習」(DX Suite;但同頁也自己註明「遮蔽或轉換無法保證完全準確」)、「在停止前取得的學習資料無法刪除或移除」(Perplexity)、「第三方可能保有使用與揭露的權利」(Manus)之類。
因此,不能只看成「既然停止學習就安心了」,而是要把 ②(是否會被人看見)與 ③(會保留多久、留在哪裡) 一起讀。
另外,這裡提到的研究是位於 34 項產品條款之外的一般公開研究。這不代表在某個特定產品上也能做出相同抽取。圖中的顏色也是根據條款文字與公開研究,編輯部對可能性的判斷,不是保證也不是評分。
這是前面那張圖的精確版。每個格子都對應到編輯部讀到的條款文字,沒有寫的部分就標成「⚪ 未記載」(沒有自行推測補上。原文可從各產品名稱的連結頁找到,並附有來源 URL 與調查日)。
產品方案① 是否會用於學習② 是否會被人看見③ 保存ChatGPT個人(免費・Go・Plus・Pro)🔴 會被使用(預設)。可由設定停止⚪ 未記載⚪ 未記載〃法人(Business・Enterprise・API)🟢 不會被使用(預設)⚪ 未記載Enterprise 可從包含日本在內的 10 個地區選擇保存地點Claude個人(Free・Pro・Max)🟢 不會被使用(僅在設定允許時)⚪ 未記載送出評價的對話最長保留 5 年〃法人(Team・Enterprise・API)🟢 不會被使用⚪ 未記載管理員可停用評價送出Claude Code個人(Free・Pro・Max)🟡 可由設定選擇⚪ 未記載若使用設定則 5 年/若不使用則 30 天〃法人(Team・Enterprise・API)🟢 不會被使用⚪ 未記載本機以明文保留 30 天Gemini個人(使用活動記錄)🔴 會被使用🔴 人類審查員會審查18 個月後自動刪除(可變更)。被人看過的部分即使刪除也最長保留 3 年〃個人(不使用活動記錄)🟢 不會被使用⚪ 未記載72 小時〃Workspace🟢 不會被使用🟢 明確寫明不會進行人工審查⚪ 未記載GitHub Copilot個人(Free・Pro・Pro+・Max)🔴 會被使用(預設)。可由設定停止⚪ 未記載⚪ 未記載〃法人(Business・Enterprise)🟢 不會被使用,除非有書面指示⚪ 未記載⚪ 未記載Perplexity個人(Free・Pro・Max)🔴 會被使用(預設)。停止前的部分無法刪除,並有明文說明⚪ 未記載⚪ 未記載(位置:記載移轉至美國)〃法人(Enterprise Pro・Max)🟢 不會被使用(也禁止第三方供應商用於學習)⚪ 未記載附件 7 天後刪除Grok個人(登入後使用)🟡 可由設定選擇(未找到預設值記載)⚪ 未記載刪除要求最長 30 天(位置:記載移轉至美國)〃個人(未登入使用)🔴 會被使用(明示授予完整權利)⚪ 未記載⚪ 未記載〃法人(Enterprise)🟢 不會被使用⚪ 未記載⚪ 未記載CursorPrivacy Mode 開啟(任何人都可設定)🟢 不會被使用(對供應商也零資料保留)⚪ 未記載若觸發違規偵測,內容可能會為調查目的而被保存〃Privacy Mode 關閉🔴 可能會被使用⚪ 未記載⚪ 未記載Codex法人工作區・API🟢 不會被使用(預設)⚪ 未記載保存地區依合約而定〃個人(Plus・Pro 等)⚪ 一次資料中找不到記載——DeepSeek個人(網頁・App)🔴 會被使用(預設)。有拒絕權⚪ 未記載位置:明示保存在中國境內〃API(開發者用)⚪ 未能確認明確條款——NotebookLM個人🟢 不會被使用(預設)🟡 僅在送出評價時,Google 會確認⚪ 未記載〃Workspace / Education🟢 不會被使用🟢 明確寫明不會交由人工審查員確認⚪ 未記載Microsoft 365 Copilot整體🟢 明確寫明不會用於基礎 LLM 的學習🟢 不正當使用監測已排除在外有可由管理員設定保存、本人也可刪除(保存在鄰近資料中心,壅塞時也可能到其他地區)「⚪ 未記載」很多這件事本身,就是這張表最重要的結論。 在這 12 項產品裡,只有 Gemini、NotebookLM、Microsoft 365 Copilot 3 項明確寫到 ②(是否會被人看見)。
為什麼只能「按方案別」來回答?因為條款本身就是按合約種類拆開寫的。 例如 GitHub Copilot 的使用條款,對個人用戶大意是「除非關閉設定或屬於法人合約,否則會授權將輸入與輸出用於 AI 開發、訓練與改善」——同一個產品名稱,只要是法人合約與否,條文中的結論就會相反。ChatGPT 的說明也同樣區分:個人版是「可能將內容用於模型訓練(可由設定關閉)」;法人版則是「Business、Enterprise 與 API 預設不會用於訓練」。Grok 更是如此:如果已登入,可由設定選擇;但未登入使用時,適用的條款會變成「你授予我們使用所提供資料進行產品開發與模型訓練的完整權利」這種意思。
所以,只說「我們公司用的是 ChatGPT」是無法直接得到答案的。要知道答案,還必須明確到是用哪個方案、哪個設定。
把條款互相比對之後,我整理出 3 個最容易踩雷的地方。
不同產品的設定名稱不一樣,這是最大的陷阱。ChatGPT 的「模型改善」、Gemini 的「Gemini 應用程式活動記錄」、Perplexity 的「AI data retention」、DX Suite 的「自動最佳化」——全部都在指 ① 的學習使用設定。
而且 Cursor 的「Privacy Mode」在啟用時,是不會被用於學習的那一側。也就是說,它的開啟意義和前面 4 個相反。Cursor 的官方資料寫的是「啟用後不會將客戶資料用於訓練」,且 Enterprise 版預設就是啟用狀態(原文在產品頁的連結裡)。
最保險的方式,是不要看名稱,而是直接看它描述的動作。 本文的圖與表之所以把各產品設定都翻成「會被使用/不會被使用/可由設定選擇」,就是這個原因。
從簽約當下、開始使用當下起,學習使用功能是預設開啟還是預設關閉,其決定方式有 3 種。
特別是,條款沒有寫明預設狀態的 3 件是這樣:
至於 DX Suite,根據使用條款寫著「【使用者】事先同意該活用」,可看出它原則上是以使用為前提;而注意事項又寫著「請在將自動最佳化設為 OFF 後再上傳」,也就是把停止動作交給使用者。因此編輯部解讀為「以學習使用已啟用為前提的寫法」。但這是編輯部的解讀,不是供應商自己明白寫出的內容。 這是我認為在簽約前很值得確認的一個問題。
把 34 件條款看過一遍後,最強烈的感受就是這一點。即使同樣寫著「不會用於學習」,實際保證範圍也差很多。
保證範圍產品供應商的說法(重點)保證之外仍可能留下的內容🟡僅限基礎模型的學習Microsoft 365 Copilot「不會用於基礎 LLM 的訓練」其他用途仍要另外判讀🟡原則上不使用,但自己也註記不保證exaBase 生成AI「但並不保證所有生成 AI 模型皆如此。」供應商自己保留例外可能性🟡不會用於其他租戶tsuzumi「不會用於其他租戶的模型。」並未否定租戶內部的學習🟡不用「學習」一詞,而是寫「服務改善」Kiro(AWS)以服務改善/不改善的說法來寫用語不一致,無法與他牌直接對照🔴這份附加條款不適用Antigravity(透過企業方案)寫著「此附加條款不適用」並沒有寫「不會使用」🟡只限自家部分;你帶入的金鑰之後的部分另計Cline、Dify、n8n、OpenClaw自家不會讓它學習。接到哪個提供者,就看哪個提供者最重要要注意的是最後這一型。自己插入 API Key 使用的工具(自帶金鑰型)只能保證「自家不會讓它學習」。 Cline 在企業頁面寫的是「不會將程式碼用於模型訓練」這類意思,但隱私通知同時也寫到:接上的 AI 模型供應商,若你沒有在那一端選擇停止學習,內容仍可能被拿去訓練。你帶入的金鑰後續會怎樣,由金鑰發行方的條款決定。
一看到「不會使用」,就要接著找出 誰的、什麼、到什麼程度 這三件事。沒有把這三件事一起讀完,同樣一句話的保證內容可能完全不同。
這是給公司內部查名字時用的清單。重點摘要是編輯部整理的,實際判斷時一定要打開連結看原文。(型別顏色:🟢 明確寫明不會使用/🟡 依條件、合約而不同/🔴 明確定義會使用/⚪ 無法確認有相關記載)
國旗代表的是開發商總部(登記地)的國家。有些產品的合約對象會是日本法人(例如 Microsoft 365 Copilot 是日本微軟,Agentforce 是 Salesforce Japan)。OpenClaw 因為是非營利 OSS 基金會,所以不標國家。
產品開發公司與國家關於學習使用的記載(摘要)型ChatGPTOpenAI 🇺🇸個人版預設會使用,可由設定關閉。法人與 API 不會使用🟡 依合約而不同ClaudeAnthropic 🇺🇸法人不會使用。個人版在設定允許等情況下會使用🟡 依合約而不同Claude CodeAnthropic 🇺🇸個人版可由設定選擇(使用=保留 5 年/不使用=30 天)。商用明示不會使用🟡 依合約而不同Claude CoworkAnthropic 🇺🇸個人版若不關閉設定則可能被使用。商用不適用🟡 依合約而不同CursorAnysphere 🇺🇸啟用 Privacy Mode 則不使用。Enterprise 預設啟用🟡 依合約而不同GeminiGoogle 🇺🇸個人版在使用活動記錄時會使用,且伴隨人工審查。Workspace 版事前未經許可不會使用🟡 依合約而不同GitHub CopilotGitHub 🇺🇸個人版預設會使用,可由設定關閉。法人除非有書面指示,否則不會使用🟡 依合約而不同GrokSpaceXAI 🇺🇸登入時可由設定選擇。未登入使用時會被使用。法人不會使用🟡 依合約而不同KiroAWS(Amazon)🇺🇸免費方案與個人合約預設會用於服務改善。企業使用者不會使用🟡 依合約而不同PerplexityPerplexity AI 🇺🇸個人版預設為會使用狀態,可由設定停止。法人合約寫明不會使用🟡 依合約而不同AntigravityGoogle 🇺🇸寫明會用於評估、開發與改善,且員工與承包商可能查看🔴 明確寫定會使用CrewAICrewAI 🇺🇸明確寫明可將輸入與輸出用於包含模型訓練在內的改善🔴 明確寫定會使用DeepSeek深度求索(DeepSeek)🇨🇳個人版明示會用於訓練與改善,且載明有拒絕權🔴 明確寫定會使用DX SuiteAI inside 🇯🇵在自動最佳化啟用的環境中,連確認與修正結果也會拿來用;若停用則完全不使用🔴 明確寫定會使用Smart OCRInfoDio 🇯🇵雲端版會作為教師資料二次利用。停止須以書面提出🔴 明確寫定會使用SmartReadCogent Labs 🇯🇵明示可用於學習等用途;畫面上取消勾選的內容不使用🔴 明確寫定會使用AgentforceSalesforce 🇺🇸明示提示與回應不會被保存,也不會用於第三方 LLM 的學習🟢 明確寫明不會使用AIReadArise Innovation 🇯🇵FAQ 明示自家的 AI 學習完全不使用🟢 明確寫明不會使用exaBase 生成AIExaWizards 🇯🇵FAQ 寫明原則上不使用,但同時註記不保證所有模型皆然🟢 明確寫明不會使用Microsoft 365 CopilotMicrosoft 🇺🇸明示不會用於基礎 LLM 訓練🟢 明確寫明不會使用NotebookLMGoogle 🇺🇸個人版若未送出評價則不會使用。Workspace 版也沒有人工審查🟢 明確寫明不會使用tsuzumiNTT 🇯🇵僅適用於同一租戶內的模型,不會用到其他租戶🟢 限於自家租戶內ClineCline Bot 🇺🇸自家提供的推論不會使用。帶入的金鑰則看提供商🟡 僅自家部分DifyLangGenius 🇺🇸明示自家不會讓其學習。帶入金鑰後續依提供商條件🟡 僅自家部分n8nn8n 🇩🇪明示不會使用客戶內容與輸出。帶入的 LLM 另計🟡 僅自家部分OllamaOllama 🇺🇸本地執行時不會蒐集、保存或傳送。雲端版也不使用🟢 在本機運作OpenClawOpenClaw Foundation(OSS)在使用者端末上運作。送到模型的內容則看金鑰發行方🟢 在本機運作CodexOpenAI 🇺🇸法人工作區與 API 不會使用。個人版未見記載🟡 只確認到法人側FeloFelo 🇯🇵法人版除非有明示同意,否則不會使用。個人版條款較有限🟡 只確認到法人側GensparkMainFunc 🇺🇸Team 與 Enterprise 明示排除於學習對象之外🟡 只確認到法人側DevinCognition 🇺🇸記載有可能會使用;適用與否視合約條件而定。未見停止手段記載🟡 視合約而定ManusButterfly Effect 🇸🇬未見直接說明可否的條文。只寫到彙整形式的改善⚪ 未見條文MakeCelonis 🇺🇸明示不會使用來自 Google Workspace API 的資料;僅限該範圍🟡 記載僅限部分LINE WORKS OCRLINE WORKS 🇯🇵本次調查未確認到學習使用的條款⚪ 未確認各產品的來源 URL 與調查日都列在 renkeimap.jp/tool 各頁。
坦白說,34 件裡有 2 件,從公開資料中無法讀出 ① 的處理方式。Manus 雖然讀了使用條款與隱私政策,但沒有找到說明是否可用於學習的條文;LINE WORKS OCR(現行 SaaS 名稱為 LINE WORKS PaperOn)則沒有找到對應記載。這不是說它們「會被使用」,也不是說「不會被使用」。如果是我漏看了,也歡迎告訴我。
把前面的內容整理成一條流程。這個順序是編輯部自己整理的,不是供應商提供的順序。
最後的第 6 步最常被忽略。學習使用的停止(opt-out)即使之後才設定,通常也不會對已經輸入的內容生效。 Perplexity 的說明明示:停止只對停止日之後取得的內容有效,停止前取得的學習資料無法刪除或移除。GitHub 的使用條款也規定,停止效力只會從生效日之後開始算。
也就是說,設定切換只對「切換當天之後」有效,在那之前輸入的內容是另一回事。這就是為什麼導入前先確認很重要。
帶走一句話「學習」有 3 條路徑重新訓練、被人看見、保存不會互相連動(§1)依路徑與資料種類不同,外洩方式也不同直接被看見的是「人會讀」這條路徑(§2)會不會原樣出現在別人答案裡,條款沒寫;逐字重現已被研究證實,但主要取決於重複次數,沒有零風險保證(§2)單位不是產品名個人與法人結論相反的有 10 件(§3)設定不要只看名稱Privacy Mode 啟用時代表不使用(§4)「不會使用」有 6 種範圍記得連著看「誰的、什麼、到什麼程度」(§4)有些產品沒寫預設值3 件只能在畫面上確認(§4)就算之後停用,過去的內容也不會消失設定切換只對「切換當天之後」有效(§6)本文不會列出哪一款產品最安全。 各條款的差異,代表的是供應商各自所處情況不同,不是優劣高低。能寫的只有:在同一天,用同一個問題逐一比對後,條文就是這樣寫的。
【可轉載】本文轉載說明
本文的文字與圖表皆可自由轉載。圖請不要經過修改直接使用。轉載時,請標註來源為 renkeimap.jp 或本文連結即可,無需事前聯絡。
※ 作者曾任職於日立系 IT 供應商、長照軟體供應商與大學醫院 IT 部門,現為獨立工作者,一邊協助中小企業進行 IT/DX 支援,一邊以一次資料調查業務系統之間的「連結」。文中的「編輯部」指的是作者所屬的 IT 連接地圖編輯部。若你發現錯誤,請透過 更正窗口(免費、無須帳號)告知。更正紀錄也有公開。
調查對象的 34 項產品(全部、關於學習使用所讀的來源)1. ChatGPT — OpenAI 說明「How your data is used to improve model performance」
※ 上述 34 件就是本文讀過「是否會用於學習」的全部對象(調查日 2026-08-26)。
連結頁面都是供應商公開的原文(使用條款、隱私政策、說明文件等)。
各產品的記載、調查日與其他項目都收在 RenkeiMap 的各頁中。