AI Agent 協定堆疊:六層之後,最下面那一層剛剛接上實體世界
一張圖,和它最下面那一格 這張圖我整理了一陣子。它想回答一個很單純的問題:當我說「幫我把這件事做完」,這句話要經過哪些協定,才會變成世界上真正發生的一個動作? 由上而下六層,從人類意圖開始,一路落到機器手臂、感測器、PLC。中間每一層都有名字、有職責、有正在成形的規格。 而最下面那一格——MHS,Model Hardware Standard——在這張圖的成熟度表裡只有 ★★☆☆☆,是全圖最低的。 我把它放在最後,不是因為它最不重要。恰恰相反:上面五層講的都是 AI 在資訊世界裡怎麼互通,只有最下面這一層在講它怎麼離開螢幕。 而那一層,八月底才剛剛有了第一個像樣的候選規格。 這篇文章分兩半。上半導讀整張圖,下半只談最下面那一格。 上半:這張圖在說什麼 由上而下,六個協定層 AG-UI / A2UI——人機互動層(Agent ↔ Human) 最貼近人的一層,而且它其實是兩件事。AG-UI 處理的是過程的可見性:即時串流、事件、狀態更新——讓你在代理跑一件長任務時,看得到它跑到哪、在想什麼、卡在哪。A2UI 處理的是介面本身:讓代理去描述要渲染的 UI 組件、表單與動作,而不是只吐一段純文字回來。 一個是「讓我看見它在做什麼」,一個是「讓它決定我看到什麼」。前者是信任問題,後者是表達力問題。 Agent Core——代理核心(大腦) 嚴格說這不是協定層,是被協定包圍的那個東西。圖裡拆成六塊:推理、規劃、記憶、知識、技能、目標。 這六塊值得一個一個念過去,因為它們常常被混為一談:知識是它知道的事實與規則,記憶是它記得的這一次與過去發生過什麼,兩者不是同一件事;技能是它能執行的動作,規劃是它決定用哪些技能、按什麼順序,兩者也不是同一件事。工程上會痛的,通常是把這幾件事塞進同一個抽象裡。 A2A——代理協調層(Agent ↔ Agent) 代理發現彼此、委派任務、同步狀態、交換結果。這一層在解的是一個組織問題而不是技術問題:當你有一百個代理,誰知道誰存在?誰有權叫誰做事?做完之後結果回給誰? 旁邊掛著一個選用的「目錄/發現服務」。圖裡每一層右邊都掛了一個這種灰色的選用註冊服務,這個設計是刻意的——待會兒會回來講。 WebMCP——Web 互動層(Agent ↔ Web) 讓網站對代理暴露機器可執行的介面:宣告式 API、結構化動作、瀏覽器內的代理執行環境。 這一層的存在本身就是一個宣告:整個 Web 是為人眼設計的,代理只能靠爬 DOM、猜按鈕、模擬點擊來用它,既脆弱又昂貴。與其讓代理繼續假裝自己是人,不如讓網站直接說「我這裡有這些動作可以呼叫」。 MCP——工具與資料層(Agent ↔ Tools / Data) 這一層現在最成熟(★★★★☆),也是我實際用得最多的一層。標準化的工具存取、資料操作、上下文管理、通用連接器。 MCP 之所以贏,是因為它解的問題夠窄:它不管代理怎麼想,只管代理伸手拿東西時介面長什麼樣。 職責邊界乾淨的協定,擴散得比什麼都快。 UCP / AP2——商務層(Agent ↔ Commerce) 支付、交易狀態、退款與爭議、對帳與結算。代理要真的替你完成一件事,通常在某個點上得付錢。這一層現在是 ★★★☆☆,卡的多半不是技術,是責任歸屬——代理刷了一筆你不想要的款,那是誰的錯? MHS——實體世界層(Agent ↔ Hardware) 裝置發現與認證、安全限制與邊界、自然語言指令、安全優先的抽象。下半整篇都在講它。 中間那顆大腦,跟一個容易被略過的迴圈 Agent Core 下面有一條虛線框:經驗回饋迴路(Experience Feedback Loop)。 ...