Anthropic 簽署了歐盟《AI 法案》中關於 AI 生成內容透明度的行為準則,並開始對 Claude 產生的文字加上不可見的統計浮水印。短短幾天內,我的資訊流裡,同一件事被解讀成了兩種完全不同的意思。

第一種解讀,來自 dev.to 的 @sylwia-lask:

{%embed https://dev.to/sylwia-lask/the-end-of-undetectable-ai-text-claudes-new-watermark-explained-45g2

她實際去讀了官方文件,並報導 Anthropic 真正的說法:這個浮水印不能證明一段文字完全由 AI 生成——你可以自己寫一段文字,讓 Claude 幫你校正或翻譯,它仍然可能帶有這個標記。反過來也一樣:沒有偵測到浮水印,不代表那就是人類寫的全部內容。

第二種解讀,來自 Medium,把這項公告稱為 AI 生成社群的「核彈」,並聲稱「你等同於背上了一個數位紅字烙印」。文中沒有引用實際文件。只有憤怒,再配上恰到好處的戲劇性標點。

在這兩者之間,我在 Sylwia 的文章底下留了評論。內容是法文,由 ChatGPT 翻譯,最後以一個問題收尾:如果一段文字是由人類構思、撰寫並審閱,但最後的英文措辭是模型產出的,你要怎麼分類? 這不是一個修辭性問題。我到現在還沒有答案。

人們一直混為一談的三件事

那篇 Medium 文章把三種幾乎毫不相關的機制混在一起,卻從未說清楚。

Anthropic 的浮水印。 一種內嵌在模型中的統計訊號,文件有明確說明,而且也坦承自身限制:經過足夠多的編修或翻譯後,它可能會消失;而它的存在,也無法說明最初是誰想出那個點子的。

第三方消費型偵測器。 ZeroGPT 及其同類工具。這些工具已經存在多年,和 Anthropic 無關,且其可靠性從未在大規模場景中被嚴肅證明過。

平台決策。 Medium 顯示的徽章、會懲罰被標記內容的策展演算法。這些都是各平台各自的編輯選擇,而不是浮水印的機械性結果。

那篇 Medium 文章寫得好像第一個環節會自動引發後面兩個:Anthropic 標記,所以偵測器會抓到一切,所以平台會懲罰。只要把這些環節拆開,這套推理就立刻崩塌——原因很簡單:偵測某個模型是否參與了文字產出,並不等同於判定這段文字是「AI 寫的」。這種混淆又遮住了更深一層的混淆,而公共討論幾乎一律忽視這一點。

輔助、生成、產出:三個不同的動詞

一段被 AI 輔助 的文字,從頭到尾都仍由人類掌握編輯控制:想法、角度、結構,以及是否發布的最終決定,都屬於某個人,不論在過程中為了修正、改寫、翻譯或壓測某個論點,和模型來回多少次。一段由 AI 生成 的文字,則是從提示詞中冒出來的,沒有那種上游控制——想法本身來自人類,但生成出來的文字,就它當下的樣子而言,屬於模型。一段以工業規模被 AI 產出 的文字又是另一回事:那是一條自動化的發佈流程,完全看不到任何像編輯把關的東西。

那麼,這三者真正的差別,不在於模型介入了多少,而在於誰還握著決策權。

這三種情況承擔的編輯責任完全不同。把它們全都當成同一類(「AI 內容」),等於用一個二元標準去評斷文字,但現實其實是一整個細膩光譜——這正是那種不加區分的「已由 AI 處理」徽章所掩蓋的。

實際測試顯示了什麼

我把一篇自己在 2021 年 4 月寫的文章——那時候還沒有面向一般使用者的 LLM——丟進了 ZeroGPT。大約一年前做過一次測試,結果顯示有 97% 的機率是 AI 產生。最近我用完全相同的文字、完全相同的工具再測一次,結果變成 8.6%。

同樣的工具。完全相同的文字,連標點符號都一模一樣。相隔一年,卻得到兩個互相矛盾的分數。

仔細看第二次測試被標記的段落,可以看出一個模式。那些不是隨機句子,而是整篇文章裡最中性、最具教學性、最有結構的段落——例如網頁伺服器是什麼的定義、CentOS Stream 的說明、一步一步的自動更新流程。真正帶出我個人語氣的段落——自嘲、口頭禪、從跳蚤市場買來的那個拿坡里摩卡壺——反而從未被標記。

單一測試不能證明偵測模型一般來說究竟在測量什麼。但這次測試強烈暗示,這個工具反應的是文體上的中性與結構的規整,而不是文字真正的來源。問題正出在這裡:這些特徵在 LLM 出現之前,就早已存在於人類寫作之中。偵測器是在追逐一種起源於人類的風格,卻拿機器對這種風格的模仿當作參照點。這套推理咬住了自己的尾巴。

這篇文章實際是怎麼完成的

既然這篇文章的重點,就是文字的來源與內容之間其實很難靠表面判斷,那麼坦白說明它是怎麼產出的,反而很重要。

起點不是這篇文章本身,而是一則 Medium 貼文底下的留言,那篇貼文讓我氣到想回覆。從那之後,我花了好幾個小時和 Claude 來回,不是要它替我寫,而是要壓測角度、核對數字,並回頭挖出原始來源,而不是依賴我自己模糊的記憶。ZeroGPT 測試也不是為了這篇文章才臨時加上的:我重新跑了一次,只是為了驗證我記得的內容,結果卻改變了我原本要下的結論。

先用法文寫出初稿——那才是我真正思考的語言。接著經過幾輪審閱,並跨不同 AI 模型交叉檢查——ChatGPT、Kimi、Grok、Mistral——用來找出不一致之處,以及論證變得鬆散的地方。然後我再自己讀一遍並修正,且是在 Claude 之外完成的(我用 NotepadMD),因為我從不會在沒逐行檢查過的情況下就把文章交出去。之後再翻成英文,接著審閱那份翻譯,因為即使是字面忠實的翻譯,如果沒人檢查,也可能把語氣出賣掉。

到這整個流程結束時,這篇文字很可能帶有浮水印。它也確實花了數小時做研究、查證,以及自動與人工審閱——而我自己的審閱也不是其中最不重要的一環:每次改寫之後,以及流程最後再次審過一次。這兩件事同時都是真的,而任何偵測器都永遠無法把它們區分開來。

一個徽章到底要付出什麼代價

以上這些都只是技術示範。它沒有說明文章一旦發表之後會發生什麼,而那可能才是更重要的部分。

一個不區分輔助、生成與產出的「已由 AI 處理」徽章,會把一個花了好幾個小時思考、查證、撰寫的作者,和一天產出一百篇文章、毫無人工把關的內容工廠,放進同一個籃子裡。匆匆掃過的讀者看不到細節——他們只看到徽章,然後把這位用心寫作的作者歸類成「騙子」。對一個沒有作弊的人來說,這確實是實質損失:他的作品會被一個既不衡量付出、也不衡量實際編輯控制的訊號來評斷,只看工具是不是曾經出現在流程中的某個環節。

而這種損失還有一個荒謬的對照面。那些拒絕帶有「AI」標記文章的讀者,卻會毫不遲疑地接受 Google 搜尋結果最上方的 AI 生成摘要——不會批判性閱讀,不會檢查它所引用的來源,也大多從不點進原文。多項獨立研究有一致結論:當 Google 搜尋出現 AI 摘要時,點擊第三方網站的流量會減少一半,甚至更多,視研究方法而定。換句話說,那些因為徽章而把一篇文章罵成「AI 垃圾」的讀者,可能在同一週裡,毫不檢查地讓 AI 幫他們摘要了另外十個主題,卻從未看過它保留了什麼、又扭曲了什麼。AI 並不是在原則上被拒絕;它是在可見、且被明確標示時被拒絕,而在隱形、並預設強加時被接受。

從點選連結轉向看摘要,也是一種更廣泛的閱讀流失,和任何徽章都無關:一篇完整、細膩、甚至自相矛盾的文章,變成三行被抹平的文字,沒有人會去質疑。讀者失去了原本會迫使他們評估來源、論證、文風的那種摩擦感——也就是徽章聲稱能幫人判斷、但摘要卻完全跳過的東西。

這並不能解決什麼

這一切都不會阻止有人在這篇文章底下留言說「AI 垃圾」。我在 dev.to 上從沒遇過這種留言。在 Reddit 上有過。

但看看這類留言通常是誰在寫。很少是真正投入主題的人。更多時候,是追逐某個能立刻引發反應的流行詞的人。在 Reddit 上,這些留言背後的帳號,常常還會對無關貼文呈現更大範圍、反射式且重複性的倒讚模式——那是一種拒絕訊號,和眼前內容本身其實沒什麼關係。

技術示範與社會判斷是兩回事,而後者不會因為前者就自動消失。「AI 垃圾」這個詞,早就不再是對文字的判斷了:它變成了一種粗暴、反射式的拒絕訊號,人們不管有沒有讀過內容都會拿來展示。

如果徽章無法測量來源,而社會判斷也不在乎這個測量,那麼也許更值得問的,不是「這是誰寫的」,而是「這是誰想透的」。

這裡的細微差別很重要。在我剛才描述的流程中,主導權從未轉手:是我開啟對話、設定主題、決定某個角度是否站得住腳、或者該不該捨棄。模型不會帶著一個我原本沒有的點子來找我。若它寫出一段我沒要求的內容,那就直接丟掉——這點從我每次保留什麼、捨棄什麼,到下一次對話,都清清楚楚看得出來。

最初對 Medium 那篇文章的反對意見,是誰先想清楚的,並選擇把浮水印、偵測器、平台區分開來,而不是把它們當成同一件事?是誰決定一個測試比一個意見更有價值,並且重跑了兩次,而不是直接憑模糊記憶重新發文?

這些問題我都能逐字、逐個決策地回答。沒有任何偵測器會問這些。它只看最終形狀,並從中推斷起源——但起源從來不在那個形狀裡。它在前面那一連串決策的過程中。


原文出處:https://dev.to/pascal_cescato_692b7a8a20/the-ai-badge-doesnt-measure-what-you-think-it-does-3ne9


精選技術文章翻譯,幫助開發者持續吸收新知。

共有 0 則留言


精選技術文章翻譯,幫助開發者持續吸收新知。
🏆 本月排行榜
🥇
站長阿川
📝9   💬4   ❤️2
259
🥈
我愛JS
💬1  
7
評分標準:發文×10 + 留言×3 + 獲讚×5 + 點讚×1 + 瀏覽數÷10
本數據每小時更新一次
📢 贊助商廣告 · 我要刊登