AI 寫的文章有其特徵性的詞彙。 這樣的分析在 Hacker News 上拿到了 663 分。
因為覺得有趣,我也想對自己 30 篇 Qiita 文章做同樣的事。
三次都失敗了。 這篇文章就是那段紀錄。
我想寫給那些覺得「中文也能用同樣的方法」而開始嘗試的人,避免你們也把同樣的時間浪費掉。
驗證環境:Windows 10 / 對象為自己的 Qiita 文章 30 篇(144,710 字)與
同一標籤的他人文章 292 篇(151 人,2,062,562 字)/ 測量時間點為 2026-08-29
這是 Louis Abraham 的分析。
收集了 85 週的 GitHub pull request 說明文,並依詞彙進行分群。
期間 2025-01-06 〜 2026-08-17(85 週)
筆數 461,121 筆說明文
總字數 51,079,244 字
方法:在 KL 資訊量下做 k-means(k=10)
結果是「load-bearing」成為 Claude 的代表性詞彙。 接著是「quietly」「latent」「genuine」。
而且10 種文體中有 1 種從 0.7% 增加到 39%,這個增長與 Opus 4.6 的發布(2026-02-05)一致。
文章中寫著「load-bearing 在內部出現 929 次、外部 82 次,差了 39 倍」。
直接相除其實只有 11.33 倍。 39 倍不是單純的出現次數比。程式庫裡有公式。
ratio(v) = (x_in_v / N_in) / ((x_out_v + ½MIN_AUTHORS) / N_out)
它是用整個語料庫的字數做正規化,分母還加了偽計數。不能直接拿 929 和 82 相除。
差點只看二手資料就寫成「只有 11 倍吧」。
這是最直覺的方法。從自己的 30 篇文章裡找 load-bearing / quietly / latent / genuine / shipped / sidecar。
出現:1 次
這很正常。 日文文章裡幾乎不會出現英文單字。那 1 次也是在英文引文中出現的。
我也數了看起來對應的日文詞(像是「靜靜地」「隱含」「潛在」「本質上」等)。
出現:7 次 / 每千字 0.05 次
這樣根本說明不了什麼。
原本的分析是取「內部與外部的頻率比」。如果把內部換成自己的文章、外部換成他人文章,理論上就能做同樣的事。
我先收集了比較對象。
自己 : 30 篇 / 144,710 字
他人 : 292 篇 / 2,062,562 字(151 人)
因為沒有裝形態素分析器,所以我用 2~6 個字連續的日文片段近似當作詞。然後用同一套公式算比例。
結果前幾名如下。
比例 內 外 詞
110.0 20 0 記しています
99.0 18 0 訳は読みやす
99.0 18 0 正確な表現は
99.0 18 0 日本語訳を併
99.0 18 0 引用は原文と
全部都是文章結尾的固定句碎片。
我每篇文章都會加上「※ 引用は原文と日本語訳を併記しています」這句註記。結果它被偵測成「我特有的詞彙」。
不是不對。 只是我想知道的不是這個。
把固定句排除後重新計算。
比例 內 外 詞
51.3 7 0 通常のサブエ
33.0 6 1 未設定
33.0 12 5 ネイティブ
11.0 6 9 と書かれてい
10.6 12 22 と思います
6.1 8 26 しかも
「通常のサブエ」「と書かれてい」都不是詞。 只是把文字機械地切開而已。
裡面也混進了一些看起來有意義的東西。「しかも」是 6.1 倍,「と思います」是 10.6 倍。至少可以說,連接詞和語尾確實有習慣性差異。
但還不到能寫成文章的程度。
我手邊有一支用來偵測 AI 文章常見說法的腳本,內建 13 種模式。
可以做 / 活用 / 關於…的介紹 / 非常 / 各種 /
進行驗證 / 不是嗎 / 可以說 / ...
我把它套用到自己的 30 篇和他人的 292 篇文章上。
自己 30 篇 他人 292 篇 總字數 144,710 2,062,562 偵測總數 11 21 每千字 0.08 0.10 沒有差異。
看細節的話,他人那邊最多的是「最後に」,每千字只有 0.04 次。母數本來就太小了。
做了 3 次之後,原因可以整理成 3 點。
1. 對象不同。 原本的分析是英文的 GitHub PR 說明文。和日文技術文章相比,寫作動機、長度、詞彙都不一樣。同樣的詞本來就不會出現。
2. 沒有形態素分析,就抓不到詞。 日文的單字不會用空白隔開。若用文字 n-gram 近似,像「通常のサブエ」這種碎片就會跑到前面。即使裝了 MeCab 等工具會改善,還是會留下下一個問題。
3. 對應詞得由自己決定。 「load-bearing 的日文版是什麼」得由我來決定。要不要放「支撐著」、要不要放「關鍵」會直接改變結論。 只要事後挑詞,什麼結論都能做出來。
第三點最致命。 原本的分析是從 5,100 萬字裡機械地分群出來的。和我手動挑十個詞,完全不是同一件事。
我文章中最具特徵的詞彙,是固定句。
「引用は原文と日本語訳を併記しています」 20 次(他人 0 次)
這是因為我在每篇文章都會照樣放上技能頁裡的註記。機械化加入的東西,也會被機械化地偵測出來。
我本來是想去找 AI 的口頭禪,結果最先被找出來的,是我自己固定加上的句子。 雖然有點諷刺,但結果很準確。
我理解到:方法越精巧,要搬到另一種語言就越困難。 數字當然可以算出來,但無法讓那些數字變得有意義。
如果硬要寫,也可以寫成「日文裡 AI 的口頭禪正在增加」。但正因為做得到,我才沒有那麼做。
參考
JQIT 的工程師中,95% 以上是從零經驗錄用的。
如果有興趣,也歡迎來公司網站逛逛。
▶ 公司網站
我們也在招募工程師。如果有興趣,請看看。
▶ 招募網站