AI 寫的文章有其特徵性的詞彙。 這樣的分析在 Hacker News 上拿到了 663 分。

因為覺得有趣,我也想對自己 30 篇 Qiita 文章做同樣的事。

三次都失敗了。 這篇文章就是那段紀錄。

我想寫給那些覺得「中文也能用同樣的方法」而開始嘗試的人,避免你們也把同樣的時間浪費掉。

驗證環境:Windows 10 / 對象為自己的 Qiita 文章 30 篇(144,710 字)與
同一標籤的他人文章 292 篇(151 人,2,062,562 字)/ 測量時間點為 2026-08-29


原本的分析做了什麼

這是 Louis Abraham 的分析。

收集了 85 週的 GitHub pull request 說明文,並依詞彙進行分群。

期間 2025-01-06 〜 2026-08-17(85 週)
筆數 461,121 筆說明文
總字數 51,079,244 字
方法:在 KL 資訊量下做 k-means(k=10)
結果是「load-bearing」成為 Claude 的代表性詞彙。 接著是「quietly」「latent」「genuine」。

而且10 種文體中有 1 種從 0.7% 增加到 39%,這個增長與 Opus 4.6 的發布(2026-02-05)一致

比例計算要注意

文章中寫著「load-bearing 在內部出現 929 次、外部 82 次,差了 39 倍」。

直接相除其實只有 11.33 倍。 39 倍不是單純的出現次數比。程式庫裡有公式。

ratio(v) = (x_in_v / N_in) / ((x_out_v + ½MIN_AUTHORS) / N_out)

它是用整個語料庫的字數做正規化,分母還加了偽計數。不能直接拿 929 和 82 相除。

差點只看二手資料就寫成「只有 11 倍吧」。


嘗試 1:把英文特徵詞原封不動地數一遍

這是最直覺的方法。從自己的 30 篇文章裡找 load-bearing / quietly / latent / genuine / shipped / sidecar

出現:1 次

這很正常。 日文文章裡幾乎不會出現英文單字。那 1 次也是在英文引文中出現的。

我也數了看起來對應的日文詞(像是「靜靜地」「隱含」「潛在」「本質上」等)。

出現:7 次 / 每千字 0.05 次

這樣根本說明不了什麼。


嘗試 2:把論文中的公式直接套到日文上

原本的分析是取「內部與外部的頻率比」。如果把內部換成自己的文章、外部換成他人文章,理論上就能做同樣的事。

我先收集了比較對象。

自己     :  30 篇 /   144,710 字
他人     : 292 篇 / 2,062,562 字(151 人)

因為沒有裝形態素分析器,所以我用 2~6 個字連續的日文片段近似當作詞。然後用同一套公式算比例。

結果前幾名如下。

  比例    內     外  詞
 110.0   20     0  記しています
  99.0   18     0  訳は読みやす
  99.0   18     0  正確な表現は
  99.0   18     0  日本語訳を併
  99.0   18     0  引用は原文と

全部都是文章結尾的固定句碎片。

我每篇文章都會加上「※ 引用は原文と日本語訳を併記しています」這句註記。結果它被偵測成「我特有的詞彙」。

不是不對。 只是我想知道的不是這個。

就算排除固定句,也還是沒辦法變成真正的詞

把固定句排除後重新計算。

  比例    內     外  詞
  51.3    7     0  通常のサブエ
  33.0    6     1  未設定
  33.0   12     5  ネイティブ
  11.0    6     9  と書かれてい
  10.6   12    22  と思います
   6.1    8    26  しかも

「通常のサブエ」「と書かれてい」都不是詞。 只是把文字機械地切開而已。

裡面也混進了一些看起來有意義的東西。「しかも」是 6.1 倍,「と思います」是 10.6 倍。至少可以說,連接詞和語尾確實有習慣性差異。

但還不到能寫成文章的程度。


嘗試 3:把 AI 味很重的說法在內外文章之間比較

我手邊有一支用來偵測 AI 文章常見說法的腳本,內建 13 種模式。

可以做 / 活用 / 關於…的介紹 / 非常 / 各種 /
進行驗證 / 不是嗎 / 可以說 / ...

我把它套用到自己的 30 篇和他人的 292 篇文章上。

自己 30 篇 他人 292 篇 總字數 144,710 2,062,562 偵測總數 11 21 每千字 0.08 0.10 沒有差異。

看細節的話,他人那邊最多的是「最後に」,每千字只有 0.04 次。母數本來就太小了。


為什麼會失敗

做了 3 次之後,原因可以整理成 3 點。

1. 對象不同。 原本的分析是英文的 GitHub PR 說明文。和日文技術文章相比,寫作動機、長度、詞彙都不一樣。同樣的詞本來就不會出現。

2. 沒有形態素分析,就抓不到詞。 日文的單字不會用空白隔開。若用文字 n-gram 近似,像「通常のサブエ」這種碎片就會跑到前面。即使裝了 MeCab 等工具會改善,還是會留下下一個問題。

3. 對應詞得由自己決定。 「load-bearing 的日文版是什麼」得由我來決定。要不要放「支撐著」、要不要放「關鍵」會直接改變結論。 只要事後挑詞,什麼結論都能做出來。

第三點最致命。 原本的分析是從 5,100 萬字裡機械地分群出來的。和我手動挑十個詞,完全不是同一件事。


不過還是有 1 件事看出來了

我文章中最具特徵的詞彙,是固定句。

「引用は原文と日本語訳を併記しています」  20 次(他人 0 次)

這是因為我在每篇文章都會照樣放上技能頁裡的註記機械化加入的東西,也會被機械化地偵測出來。

我本來是想去找 AI 的口頭禪,結果最先被找出來的,是我自己固定加上的句子。 雖然有點諷刺,但結果很準確。


總結

  • 原本的分析(HN 663 分)是把 461,121 筆 GitHub PR 說明文、5,100 萬字用 KL 資訊量做
    分群,指出 「load-bearing」是 Claude 的代表詞
  • 不是「929 次 / 82 次 = 39 倍」。 它是用整個語料庫正規化後的比例,
    單純相除只有 11.33 倍。直接照抄二手資料的數字會出錯
  • 我對 30 篇日文文章做了 3 次追試,三次都失敗了
    • 把英文特徵詞直接數一遍 → 30 篇只出現 1 次
    • 把同樣公式套到日文 → 固定句碎片佔據前幾名
    • 比較 AI 味很重的說法 → 每千字 0.08 對 0.10,沒有差異
  • 原因有 3 個:對象不同 / 沒有形態素分析就抓不到詞 / 對應詞得自己決定
  • 第三點最致命。 只要事後選詞,任何結論都做得出來

我理解到:方法越精巧,要搬到另一種語言就越困難。 數字當然可以算出來,但無法讓那些數字變得有意義。

如果硬要寫,也可以寫成「日文裡 AI 的口頭禪正在增加」。但正因為做得到,我才沒有那麼做。


參考

相關文章


JQIT 的工程師中,95% 以上是從零經驗錄用的。
如果有興趣,也歡迎來公司網站逛逛。

公司網站

我們也在招募工程師。如果有興趣,請看看。

招募網站


原文出處:https://qiita.com/jqit_suwa/items/4231026d13f7527c0f69


精選技術文章翻譯,幫助開發者持續吸收新知。

共有 0 則留言


精選技術文章翻譯,幫助開發者持續吸收新知。
🏆 本月排行榜
🥇
站長阿川
📝13   💬4  
178
🥈
我愛JS
💬1  
6
評分標準:發文×10 + 留言×3 + 獲讚×5 + 點讚×1 + 瀏覽數÷10
本數據每小時更新一次
📢 贊助商廣告 · 我要刊登