過去幾個小時,整個世界——或者至少是我的 LinkedIn 動態——都在討論同一件事:Anthropic 簽署了 EU AI Act(歐盟人工智慧法案)關於 AI 生成內容透明度的實務守則。
這是不是代表那些有趣的貓咪故事、LinkedIn 貼文和無聊文件的生成時代結束了?我們完蛋了嗎?我們是不是得像原始人一樣,手動把那些無聊東西一字一句寫出來,否則某個神祕偵測器就會把我們抓包?😅
我實在忍不住想寫這篇!網路上已經針對這個話題產生了相當多的迷思,所以我們快速來看一下目前確實已知的事實。順帶一提,這些資訊其實在 Claude 的官方頁面上就很容易找到,而且那裡的文件比很多業界文章都更好讀。
而且你會看到,真的沒什麼好怕的。另外……Anthropic 甚至還不是第一個做這件事的公司。
當然沒有!
如果你像我一樣是歐盟公民,你還是可以請 AI 幫你回覆一封無聊的電子郵件,或生成一首荒謬的詩,你不會因此被抓去關。😉
目標不是禁止 AI,而是讓 AI 生成與被操控的內容能被機器辨識,並且在特定情境下對使用者保持透明——尤其是涉及 deepfake,或與公共利益相關的內容時。
這裡還有一個重要細節:AI Act 也為某些 AI 生成或經過修改的文字提供例外,如果內容已經經過人工審查或編輯控制,且由自然人或法人負責其出版責任,則不在此限。
所以,不,歐盟並沒有對你用 ChatGPT 寫的電子郵件宣戰。
以下是截至今天我們確定知道的事:
Anthropic 稱之為一種「嵌入在文字中、無法被感知的浮水印」。
根據 Anthropic 的說法,它可以在複製貼上後保留下來,甚至在一定程度的編輯後仍可能存在。它是在模型層級實作,而不是 Claude 前端事後額外加上的東西。
但重點來了:Anthropic 目前還沒有明說它到底怎麼運作!
公司表示會有更技術性的文件陸續釋出,所以……等它出來後,我也會再寫一篇追蹤。😀
我們可以合理推測,它可能是一種統計式 token 浮水印。這類系統不是靠奇怪的空白字元或看不見的 Unicode 字元,這種東西一下就能刪掉。相反地,模型在生成時會對某些 token 產生輕微且具有統計性的偏好。
對單一句子來說,這種訊號可能無法偵測,或者偵測結果不可靠。但在較長的文字中,統計特徵就可能開始浮現。
所以,粗略來說,你可以想像成這樣(如果 Anthropic 的浮水印是這樣實作的話):
一般生成
P(next_token | context)
vs.
帶浮水印的生成
P(next_token | context) + secret statistical bias
但再次強調:Anthropic 目前還沒有證實 Claude 的浮水印就是這樣運作的。
這只是根據現有文字浮水印技術所做的合理推測。🙂
不是!
Google 其實已經做這件事好幾年了。
Google DeepMind 早在 2024 年就推出了 SynthID Text,其運作方式大致和我上面描述的一樣:在 token 生成過程中加入浮水印,形成一個之後可以被偵測的統計訊號。
至於 OpenAI,則表示他們已開發文字浮水印技術;雖然他們已經在圖片、影片和音訊等內容上使用來源證明或浮水印技術,但尚未公開推出與一般 GPT 文字回覆相當的浮水印機制。
所以,Anthropic 當然不是第一個想到對 LLM 輸出加浮水印的人。
目前還不知道。
對於支援的檔案,情況會簡單一些,因為 Anthropic 使用來源證明中繼資料,例如 C2PA 憑證,可以透過適當的驗證工具來檢查。
但文字就更有意思了。
Anthropic 表示,未來會讓第三方與研究人員使用浮水印偵測功能,但我們還不清楚這些第三方到底會是誰、存取方式會是什麼樣子,或一般使用者之後是否會拿到簡單的公開偵測器。
所以 GPTZero 和類似的垃圾工具,可能還會再有一陣子工作可做。
一切會因此變得一清二楚嗎?每篇 LLM 生成的文章旁邊,之後都會突然出現一個超大紅色的 作弊者! 警告嗎?xD 當然不會!
Anthropic 自己也公開談到這項技術的限制。這類問題我們在 DEV 上其實已經討論過幾千次了。
首先,浮水印存在並不一定代表作者不是自己寫的。
也許他們是自己寫了整篇內容,然後請 Claude 幫忙編輯、修正文法、潤飾措辭,或翻譯成另一種語言。即使實際想法,甚至大部分原始文字都來自人類作者,最後輸出仍可能帶有浮水印。
所以,是的,最後文章還是可能一樣混亂、冗長,充滿一大堆離題內容,跟我在這裡發的貼文一模一樣。
Anthropic 也明確指出,反過來的情況同樣可能發生。
有人可以把完全由 AI 生成的垃圾內容大幅修改、改寫、翻譯、混入其他內容,或用其他方式把它改到浮水印不再可偵測。
所以:
偵測到浮水印 ≠ AI 寫了全部內容
而且
沒偵測到浮水印 ≠ 人類寫了全部內容
這是非常重要的區別。
對於支援的檔案,來源證明會比較容易驗證,因為我們可以使用內嵌中繼資料和內容憑證。不過,這也不是萬無一失。
例如,如果有人把一張 AI 生成圖片截圖了,中繼資料並不會神奇地在所有可能的轉換中都保留下來。
這也正是為什麼來源證明很有用,但它不是什麼完美的、通用的 AI 偵測器。
這大概是我最感興趣的部分。對於生成的程式碼,他們到底打算怎麼處理浮水印?因為在程式碼裡,模型能選擇的等價 token 空間比自然語言小得多。
在自然語言中,要表達同一個意思,往往有幾十種完全合理的說法。但如果我們有像這樣的程式碼:
const result = await fetchData();
那到底要怎麼對這段內容加入統計浮水印?
當然,還是有一些可變項:變數名稱、格式等等。但可替換的合法空間顯然比自然語言受限得多,而 formatter、重構、壓縮,甚至只是小小的人為修改,都可能讓這個問題變得更有趣。
Claude Code 已包含在 Anthropic 的標記推行範圍內,但 Anthropic 目前還沒有公布足夠多的技術細節,讓我們知道對生成的原始碼來說,這個文字浮水印到底會怎麼表現。
而我真的很想知道他們是怎麼解決這個問題的。
如你所見,Claude 對生成文字加浮水印,其實是一個合乎邏輯且重要的步驟,雖然顯然還不完美。
它大概不會改變我們日常生活太多。
當然,社群媒體上滿天飛的 AI 垃圾內容很惱人。不過很遺憾,我覺得這個浮水印也不會神奇地解決那個問題。😐
我更感興趣的是這個浮水印到底是怎麼實作的。
Anthropic,我在等文件!
原文出處:https://dev.to/sylwia-lask/the-end-of-undetectable-ai-text-claudes-new-watermark-explained-45g2