AI Agent 協定堆疊:六層之後,最下面那一層剛剛接上實體世界

一張圖,和它最下面那一格 這張圖我整理了一陣子。它想回答一個很單純的問題:當我說「幫我把這件事做完」,這句話要經過哪些協定,才會變成世界上真正發生的一個動作? 由上而下六層,從人類意圖開始,一路落到機器手臂、感測器、PLC。中間每一層都有名字、有職責、有正在成形的規格。 而最下面那一格——MHS,Model Hardware Standard——在這張圖的成熟度表裡只有 ★★☆☆☆,是全圖最低的。 我把它放在最後,不是因為它最不重要。恰恰相反:上面五層講的都是 AI 在資訊世界裡怎麼互通,只有最下面這一層在講它怎麼離開螢幕。 而那一層,八月底才剛剛有了第一個像樣的候選規格。 這篇文章分兩半。上半導讀整張圖,下半只談最下面那一格。 上半:這張圖在說什麼 由上而下,六個協定層 AG-UI / A2UI——人機互動層(Agent ↔ Human) 最貼近人的一層,而且它其實是兩件事。AG-UI 處理的是過程的可見性:即時串流、事件、狀態更新——讓你在代理跑一件長任務時,看得到它跑到哪、在想什麼、卡在哪。A2UI 處理的是介面本身:讓代理去描述要渲染的 UI 組件、表單與動作,而不是只吐一段純文字回來。 一個是「讓我看見它在做什麼」,一個是「讓它決定我看到什麼」。前者是信任問題,後者是表達力問題。 Agent Core——代理核心(大腦) 嚴格說這不是協定層,是被協定包圍的那個東西。圖裡拆成六塊:推理、規劃、記憶、知識、技能、目標。 這六塊值得一個一個念過去,因為它們常常被混為一談:知識是它知道的事實與規則,記憶是它記得的這一次與過去發生過什麼,兩者不是同一件事;技能是它能執行的動作,規劃是它決定用哪些技能、按什麼順序,兩者也不是同一件事。工程上會痛的,通常是把這幾件事塞進同一個抽象裡。 A2A——代理協調層(Agent ↔ Agent) 代理發現彼此、委派任務、同步狀態、交換結果。這一層在解的是一個組織問題而不是技術問題:當你有一百個代理,誰知道誰存在?誰有權叫誰做事?做完之後結果回給誰? 旁邊掛著一個選用的「目錄/發現服務」。圖裡每一層右邊都掛了一個這種灰色的選用註冊服務,這個設計是刻意的——待會兒會回來講。 WebMCP——Web 互動層(Agent ↔ Web) 讓網站對代理暴露機器可執行的介面:宣告式 API、結構化動作、瀏覽器內的代理執行環境。 這一層的存在本身就是一個宣告:整個 Web 是為人眼設計的,代理只能靠爬 DOM、猜按鈕、模擬點擊來用它,既脆弱又昂貴。與其讓代理繼續假裝自己是人,不如讓網站直接說「我這裡有這些動作可以呼叫」。 MCP——工具與資料層(Agent ↔ Tools / Data) 這一層現在最成熟(★★★★☆),也是我實際用得最多的一層。標準化的工具存取、資料操作、上下文管理、通用連接器。 MCP 之所以贏,是因為它解的問題夠窄:它不管代理怎麼想,只管代理伸手拿東西時介面長什麼樣。 職責邊界乾淨的協定,擴散得比什麼都快。 UCP / AP2——商務層(Agent ↔ Commerce) 支付、交易狀態、退款與爭議、對帳與結算。代理要真的替你完成一件事,通常在某個點上得付錢。這一層現在是 ★★★☆☆,卡的多半不是技術,是責任歸屬——代理刷了一筆你不想要的款,那是誰的錯? MHS——實體世界層(Agent ↔ Hardware) 裝置發現與認證、安全限制與邊界、自然語言指令、安全優先的抽象。下半整篇都在講它。 中間那顆大腦,跟一個容易被略過的迴圈 Agent Core 下面有一條虛線框:經驗回饋迴路(Experience Feedback Loop)。 ...

September 1, 2026 · 2 分鐘 · 392 字 · ChenFu Kuo

AI-HIL:當 AI 長出了眼睛和手,讓嵌入式開發閉環自動化

從一句抱怨開始 第三天了。 這塊點心小板真的夠硬。Claude Code 在大放送期間讓我能一直衝,結果還是頂到了用量限制。早上後來去參加研討會,腦子裡一直在想一件事: 我花了多少時間在 copy/paste? JTAG 的 call stack、SWD 的暫存器狀態、Serial Console 的 log——一段貼過去,AI 給建議,我改一下 code,重新 build、flash、再抓 log,再貼回去。來來回回。有時貼錯視窗,有時貼漏了關鍵的那幾行。 跟以前純靠自己 debug 比起來,確實快很多。但還是不夠快。Bug 像俄羅斯套娃,抓掉一層,裡面還有一層。每一次的「這次應該好了」到「怎麼又掛了」的迴圈,都讓人想把鍵盤推開。 所以我在想,如果能消除人為因素的話呢? 一個想法:給 AI 眼睛跟手 問題說清楚了就好解決。 我需要的不是更聰明的 AI,而是讓 AI 能自己看、自己動、自己驗。 不再是我充當「人肉資料傳輸管道」,把硬體的訊號用眼睛看完之後再貼給 AI,而是讓 AI 直接接上硬體的感知介面,取得第一手的訊號,做出判斷,然後直接驅動工具鏈——build、flash、reset——再自己確認結果。 這個想法就是 AI-HIL(AI Hardware-in-the-Loop)。 Giving hardware the soul of AI, realizing automated closed-loop development in the physical world. AI-HIL 是什麼 AI-HIL 把 Claude Code 從「code 產生器」升級成「系統級工程師」。 透過 Model Context Protocol (MCP),Claude Code 連接到實體硬體,獲得三種能力: 感知(Perception):讀 Serial log、JTAG call stack、電流波形、Camera 畫面 行動(Action):Build/Flash firmware、硬體 Reset、電源控制 閉環驗證(Closed-Loop Validation):自動確認修復是否有效,記錄 bug 模式 換句話說,AI 不再只是坐在我旁邊出主意,而是能自己上工的 AI Employee。 ...

March 20, 2026 · 2 分鐘 · 370 字 · ChenFu Kuo