AI安全性到底該從哪裡開始學?

目錄

前言

「用 AI 提升業務效率!」「用 AI 驅動開發,超高速寫程式!」

最近不管是在社群媒體還是公司內部,都是這類話題,老實說有點膩了。
我這個人個性還滿愛唱反調的,
所以就想著:「雖然知道 AI 很方便,但會不會像雲端技術剛興起時一樣,AI 也是先導入,之後才逐漸浮現出安全性的重要性呢?」於是就開始研究 AI 安全性。

坦白說,除了出於知識上的好奇,我心裡大多數還是抱著「這應該會變成供不應求的領域吧(也就是應該很好賺)」這種小心思。

簡單自我介紹

前陣子剛從舊系統維護工作畢業的前宅男。

因為這是個看起來門檻很高的領域,所以我反而覺得,像我這樣的人在學習過程中留下紀錄,應該會很有幫助。
如果有懂這方面的前輩,還請溫柔指教,真的拜託了。

調查過的來源與術語

首先,我把目前覺得需要先著手的資訊整理成清單。

  • OWASP Top 10 for LLM
    • 針對使用 LLM 的系統而言,可說是脆弱性領域的聖經級存在。
  • 提示注入(Prompt Injection)
    • 在上述 OWASP Top 10 for LLM 中,被視為「最需要警戒的風險」的攻擊手法,可說是壓倒性的 MVP。
    • 特別是「間接提示注入」,很可能以 RAG 環境為目標,且具備實際可驗證性,是非常有趣的主題。
  • arXiv
    • 用來掌握最新攻擊手法的一手資料來源。這是全球最大的預印本伺服器,會公開尚未經過同儕審查的論文。
    • 因為眾所周知的漏洞通常已經被修補,所以需要持續追蹤最新手法。
  • 數位發展部「AI 指引」與「前瞻 AI 應用諮詢委員會」
    • 透過了解行政層級正在制定什麼樣的標準,來掌握實際導入到商業場景時的平衡點。

近期學習計畫

1. 論文閱讀(蒐集第一手資料)

先從品質較高的第一手資料下手。我和 Gemini 討論後,決定先從以下三篇開始:

  • A Survey of Attacks on Large Language Models(掌握整體樣貌)
  • Indirect Prompt Injection in the Wild for LLM Systems(具體攻擊案例)
  • Benchmarking Poisoning Attacks against Retrieval-Augmented Generation(RAG 特有威脅)

2. 建置驗證環境

我本機已經有 WSL + Docker 環境,所以會先建立一個簡單的 RAG 行為與提示注入實驗環境。

等到大致熟悉之後,我打算再移轉到雲端進行驗證。雖然到時候可能會被雲端費用和 IaC 管理搞得有點頭大,但我想把這部分當成「出身舊系統的工程師,如何駕馭現代化開發環境」這個脈絡來分享。

3. 透過部落格與技術文章輸出

前面也有提到,我希望未來的內容能對那些正準備開始學習 AI 安全性的人有所幫助。

理想的學習循環

未來我想把以下這個循環持續跑起來。

1. 蒐集第一手資料(閱讀 arXiv 論文)
AI 領域的論文數量也太多了吧?而且變化速度又超快,如果只靠手動追進度,真的會一下就淹沒。
之後我希望能善用腳本、RSS 等工具,把從資訊蒐集到摘要整理都自動化(系統化)。
不過,如果一開始就想做出完美的流程,絕對會先挫折,所以我打算先老老實實地手動閱讀,再慢慢把重複工作減少。

2. 進行驗證
讀完論文後,我不想只停留在「喔~好厲害」就結束,而是想實際動手做;但如果每次都手動建驗證環境,久了又會很耗時間、很辛苦。
所以我希望盡早借助容器與 IaC 的力量,建立一套能快速完成驗證部署與測試的機制,也就是半自動化流程。

3. 思考對策
像是「整個系統的權限該怎麼設計」「如何偵測可疑行為,並在營運層面補強」這類系統架構與營運上的平衡點,我想自己也試著思考看看。
這部分很考驗系統工程師的功力,所以如果未來真的成為最佳實踐,那就有地方可以得意一下了。

結語

這次幾乎變成像是決心宣言一樣的內容了。
我會努力不要半途消失,還請大家用溫柔一點的眼光守望我。(前科已有兩次失蹤)
那我們下次見!


原文出處:https://qiita.com/mikihitooooo/items/ced6a0aa744379d338b6


精選技術文章翻譯,幫助開發者持續吸收新知。

共有 0 則留言


精選技術文章翻譯,幫助開發者持續吸收新知。
🏆 本月排行榜
🥇
站長阿川
📝12   💬4   ❤️2
297
🥈
我愛JS
💬1  
7
評分標準:發文×10 + 留言×3 + 獲讚×5 + 點讚×1 + 瀏覽數÷10
本數據每小時更新一次
📢 贊助商廣告 · 我要刊登