過去幾個小時,整個世界——或者至少是我的 LinkedIn 動態——都在討論同一件事:Anthropic 簽署了 EU AI Act(歐盟人工智慧法案)關於 AI 生成內容透明度的實務守則

這是不是代表那些有趣的貓咪故事、LinkedIn 貼文和無聊文件的生成時代結束了?我們完蛋了嗎?我們是不是得像原始人一樣,手動把那些無聊東西一字一句寫出來,否則某個神祕偵測器就會把我們抓包?😅

我實在忍不住想寫這篇!網路上已經針對這個話題產生了相當多的迷思,所以我們快速來看一下目前確實已知的事實。順帶一提,這些資訊其實在 Claude 的官方頁面上就很容易找到,而且那裡的文件比很多業界文章都更好讀。

而且你會看到,真的沒什麼好怕的。另外……Anthropic 甚至還不是第一個做這件事的公司。

等等,為什麼我們需要這條法律?AI 生成文字在歐洲變成違法了嗎?

當然沒有!

如果你像我一樣是歐盟公民,你還是可以請 AI 幫你回覆一封無聊的電子郵件,或生成一首荒謬的詩,你不會因此被抓去關。😉

目標不是禁止 AI,而是讓 AI 生成與被操控的內容能被機器辨識,並且在特定情境下對使用者保持透明——尤其是涉及 deepfake,或與公共利益相關的內容時。

這裡還有一個重要細節:AI Act 也為某些 AI 生成或經過修改的文字提供例外,如果內容已經經過人工審查或編輯控制,且由自然人或法人負責其出版責任,則不在此限。

所以,不,歐盟並沒有對你用 ChatGPT 寫的電子郵件宣戰。

到目前為止,我們實際知道些什麼?

以下是截至今天我們確定知道的事:

  • Anthropic 確實簽署了 EU AI Act 第 50(2) 條 AI 生成內容透明度實務守則,並且作為其實施的一部分,正在提供機器可讀的標記。相關的透明度義務已於 2026 年 8 月 2 日開始適用。所以,是的,我們現在已經進入這個階段了。
  • 2026 年 8 月 2 日之後推出的 Claude 模型,從一開始就具備標記能力。較舊的模型不一定已經具備,Anthropic 正在逐步推行。
  • 這套系統是全球適用的。沒錯,即使在歐盟以外也一樣。
  • 它適用於透過 Claude、Claude Platform/API、Claude Code、Claude Cowork 和 Claude Tag 使用的支援 Claude 模型。
  • 如果你是透過 AWS、Google Cloud、Microsoft Foundry 或其他支援平台使用 Claude?標記是套用在模型層級的,所以換個介面並不會讓它憑空消失。
  • 這裡涉及兩種不同機制:生成文字的不可感知浮水印,以及支援檔案的來源證明中繼資料。

所以……這個浮水印到底是怎麼運作的?

Anthropic 稱之為一種「嵌入在文字中、無法被感知的浮水印」

根據 Anthropic 的說法,它可以在複製貼上後保留下來,甚至在一定程度的編輯後仍可能存在。它是在模型層級實作,而不是 Claude 前端事後額外加上的東西。

但重點來了:Anthropic 目前還沒有明說它到底怎麼運作!

公司表示會有更技術性的文件陸續釋出,所以……等它出來後,我也會再寫一篇追蹤。😀

我們可以合理推測,它可能是一種統計式 token 浮水印。這類系統不是靠奇怪的空白字元或看不見的 Unicode 字元,這種東西一下就能刪掉。相反地,模型在生成時會對某些 token 產生輕微且具有統計性的偏好。

對單一句子來說,這種訊號可能無法偵測,或者偵測結果不可靠。但在較長的文字中,統計特徵就可能開始浮現。

所以,粗略來說,你可以想像成這樣(如果 Anthropic 的浮水印是這樣實作的話):

一般生成

P(next_token | context)

vs.

帶浮水印的生成

P(next_token | context) + secret statistical bias

但再次強調:Anthropic 目前還沒有證實 Claude 的浮水印就是這樣運作的。

這只是根據現有文字浮水印技術所做的合理推測。🙂

Claude 是唯一會對文字做浮水印的模型嗎?

不是!

Google 其實已經做這件事好幾年了。

Google DeepMind 早在 2024 年就推出了 SynthID Text,其運作方式大致和我上面描述的一樣:在 token 生成過程中加入浮水印,形成一個之後可以被偵測的統計訊號。

至於 OpenAI,則表示他們已開發文字浮水印技術;雖然他們已經在圖片、影片和音訊等內容上使用來源證明或浮水印技術,但尚未公開推出與一般 GPT 文字回覆相當的浮水印機制。

所以,Anthropic 當然不是第一個想到對 LLM 輸出加浮水印的人。

每個人都能用浮水印偵測器嗎?

目前還不知道。

對於支援的檔案,情況會簡單一些,因為 Anthropic 使用來源證明中繼資料,例如 C2PA 憑證,可以透過適當的驗證工具來檢查。

但文字就更有意思了。

Anthropic 表示,未來會讓第三方與研究人員使用浮水印偵測功能,但我們還不清楚這些第三方到底會是誰、存取方式會是什麼樣子,或一般使用者之後是否會拿到簡單的公開偵測器。

所以 GPTZero 和類似的垃圾工具,可能還會再有一陣子工作可做。

這對我們到底意味著什麼?

一切會因此變得一清二楚嗎?每篇 LLM 生成的文章旁邊,之後都會突然出現一個超大紅色的 作弊者! 警告嗎?xD 當然不會!

Anthropic 自己也公開談到這項技術的限制。這類問題我們在 DEV 上其實已經討論過幾千次了。

首先,浮水印存在並一定代表作者不是自己寫的。

也許他們是自己寫了整篇內容,然後請 Claude 幫忙編輯、修正文法、潤飾措辭,或翻譯成另一種語言。即使實際想法,甚至大部分原始文字都來自人類作者,最後輸出仍可能帶有浮水印。

所以,是的,最後文章還是可能一樣混亂、冗長,充滿一大堆離題內容,跟我在這裡發的貼文一模一樣。

Anthropic 也明確指出,反過來的情況同樣可能發生。

有人可以把完全由 AI 生成的垃圾內容大幅修改、改寫、翻譯、混入其他內容,或用其他方式把它改到浮水印不再可偵測。

所以:

偵測到浮水印 ≠ AI 寫了全部內容

而且

沒偵測到浮水印 ≠ 人類寫了全部內容

這是非常重要的區別。

那圖片、音訊和影片呢?

對於支援的檔案,來源證明會比較容易驗證,因為我們可以使用內嵌中繼資料和內容憑證。不過,這也不是萬無一失。

例如,如果有人把一張 AI 生成圖片截圖了,中繼資料並不會神奇地在所有可能的轉換中都保留下來。

這也正是為什麼來源證明很有用,但它不是什麼完美的、通用的 AI 偵測器。

那程式碼到底會怎麼辦?

這大概是我最感興趣的部分。對於生成的程式碼,他們到底打算怎麼處理浮水印?因為在程式碼裡,模型能選擇的等價 token 空間比自然語言小得多。

在自然語言中,要表達同一個意思,往往有幾十種完全合理的說法。但如果我們有像這樣的程式碼:

const result = await fetchData();

那到底要怎麼對這段內容加入統計浮水印?

當然,還是有一些可變項:變數名稱、格式等等。但可替換的合法空間顯然比自然語言受限得多,而 formatter、重構、壓縮,甚至只是小小的人為修改,都可能讓這個問題變得更有趣。

Claude Code 已包含在 Anthropic 的標記推行範圍內,但 Anthropic 目前還沒有公布足夠多的技術細節,讓我們知道對生成的原始碼來說,這個文字浮水印到底會怎麼表現。

而我真的很想知道他們是怎麼解決這個問題的。

所以,你應該在意嗎?

如你所見,Claude 對生成文字加浮水印,其實是一個合乎邏輯且重要的步驟,雖然顯然還不完美。

它大概不會改變我們日常生活太多。

當然,社群媒體上滿天飛的 AI 垃圾內容很惱人。不過很遺憾,我覺得這個浮水印也不會神奇地解決那個問題。😐

我更感興趣的是這個浮水印到底是怎麼實作的

Anthropic,我在等文件!


原文出處:https://dev.to/sylwia-lask/the-end-of-undetectable-ai-text-claudes-new-watermark-explained-45g2


精選技術文章翻譯,幫助開發者持續吸收新知。

共有 0 則留言


精選技術文章翻譯,幫助開發者持續吸收新知。
🏆 本月排行榜
🥇
站長阿川
📝9   💬4   ❤️2
253
🥈
我愛JS
💬1  
4
評分標準:發文×10 + 留言×3 + 獲讚×5 + 點讚×1 + 瀏覽數÷10
本數據每小時更新一次
📢 贊助商廣告 · 我要刊登