交付前,品質等於零
Skywork 初期 PPT 品質已達 SOTA,但新用戶任務完成率低於 50%:使用者還沒看到結果,就因等待過久離開。
評估 Agent,不是替一次輸出打分,而是判斷一位「頂尖實習生」的長期工作能力:能否理解弦外之音、累積前情、拆解模糊目標、修正錯誤,並知道何時該停下來請示。
常見的六種數字都能解釋局部,卻沒有一個能獨立回答「好不好」。任務完成不等於品質達標、步數少不等於耗時短,Token 省了也可能犧牲產出。
Skywork 初期 PPT 品質已達 SOTA,但新用戶任務完成率低於 50%:使用者還沒看到結果,就因等待過久離開。
工程優化把 20 分鐘降到 5 分鐘,完成率大幅提升;但只追速度,又可能讓耗時功能被砍,反過來傷害品質。
使用者可能對品質滿意,卻因點數太貴按踩;也可能因任務已交付而不回饋。顯性與隱性行為都受動機干擾。
少用 Token 不代表更好;若換來重做、低品質或錯誤方向,只是把成本轉移到使用者身上。
步數少但單步很慢,與步數多但能自主修正,不能直接相比。需要連結耗時、品質與修復效果。
真實任務同時受目標、資料、工具、驗收與風險限制;單題答案正確,未必代表整個任務做對。
速度優化首先解決的是「結果還沒出來,人就走了」。完成率是所有品質指標成立的前提,而不是與品質無關的另一條 KPI。
若為了繼續縮短時間而刪除必要的深度功能,完成率可能上升,成果價值卻下降。更合理的做法,是把耗時與完成率、品質、返工及功能覆蓋放在同一條任務 Trace 上判讀。
超過 20% 的點踩案例,同時伴隨品質好、速度快,甚至點踩後仍充值。問題不是「做得差」,而是使用者覺得這一單不值。
輸出是否專業、任務是否有效率、技術指標是否進步。
點數、等待、修改力氣、溝通成本,以及出錯後的心理與工作風險。
使用者不只問「做得好不好」,也在問「花這麼多,到底值不值」。
研究方法也要改:不要只當評測員。講者建議親自付費、帶著真實任務進賽道,再以競品完成同一任務;只有成本落在自己身上,才感受得到付費衝動、想切換與想分享的真實時刻。
三次升級其實在回答同一件事:應該服務誰、用什麼單位定義成功,以及如何避免昨天正確的指標變成今天的誤導。
一次性需求目標明確、上下文少、交付邊界清楚,模型升級後容易被內化,使用者做完即走。真正能發揮 Agent 價值的是跨多場景、可累積上下文與偏好、合作成本持續下降的長期專案。
早期用 PPT、文件、網頁入口要求使用者先分類需求,評估也停留在產物品質。Agent 的範圍更深更廣,標準應前移到「是否推進整體任務」,而不是「有沒有把某份 PPT 做完」。
線上演示很漂亮,80%+ 使用者仍選擇匯出,原因可能是 2025 年組織尚未 AI 化、員工要向上彙報且不想暴露 AI 痕跡;到了 2026 年,HTML 展示成熟、組織加速 AI 化,線上演示重新獲得價值。不是功能突然變好,而是工作流變了。

上下文累積後,單位產出價值上升,持續使用與協作成本下降,形成正向剪刀差。
模型、工具與存取權限演進,會持續改寫可完成任務的範圍。
價值不是產出一份文件,而是在真實環境中把任務推進到閉環。
以早期用戶行為為例:大量人購買小額 SKU、需求出現就訂閱、完成後退訂、下次再訂。這不是單純「不滿意」,而是產品被當成臨時工具。若目標是終態 Agent,核心用戶應是能持續獲益的重度使用者,而非只有一次性交付的人。
框架不是一次性評分表,而是 Agent 長期工作能力的座標系。它來自一個直覺:人們判斷優秀實習生的標準,幾乎與判斷好 Agent 重疊。
能識別資訊缺口、主動取得與補充資料,最後把資訊真正用進判斷;衡量重點不是抓了多少,而是是否改變任務結果。
及格是聽懂字面;優秀是結合線索、語境與推理,理解未明說的真實意圖。例如「最近火爆的龍蝦」應推斷可能指 OpenClaw,而非真的做餐飲簡報。
記錄不等於記憶。必須經歷「記錄 → 理解穩定偏好與一次性脈絡 → 在下一任務主動應用」,而且要確實改變交付結果。
命令型需求容易完成;真正差距在祈願型需求。面對「做一份競品分析」,要先判斷分析目的,再拆成範圍、證據、維度、機會與建議。
以「做對」而非「完成」為目標。工具失敗時,替代路線必須重新驗證是否仍符合需求;不能為了完成狀態交付不可用結果。
知道何時請示、何時自主。資訊不足要指出缺口;權限不足要明說;能力不足要承認不確定並提供可驗證的下一步。
每個維度都要落到可觀察的行為與結果,而不是形容詞。評測單位也要從單輪答案升級成多輪、跨任務、帶工具與限制的工作樣本。
| 維度 | 應觀察的證據 | 常見假陽性 | 較好的判定 |
|---|---|---|---|
| 基礎學識 | 缺口辨識、補充資料、引用於推理 | 搜尋很多、資料很長 | 新增資訊實際改變決策或交付 |
| 悟性理解 | 還原意圖、辨識語境、必要時確認 | 字面完全照做 | 既不腦補,也不漏掉明顯弦外之音 |
| 長記憶 | 跨任務調用穩定偏好與歷史依據 | 只把聊天記錄塞進上下文 | 記憶精準且可見地改善下一次結果 |
| 任務拆解 | 目標、路徑、證據與驗收可追蹤 | 列一份漂亮待辦清單 | 抽象需求被轉成可執行、可驗證閉環 |
| 自主糾錯 | 發現偏差、切換路徑、重新驗證 | 重試很多次就算自癒 | 修復後仍符合原需求與品質門檻 |
| 邊界自知 | 缺資訊、缺權限、缺能力時的決策 | 凡事詢問或凡事硬做 | 只影響局部可透明假設;會改變方向則停下請示 |
目前 Agent 多半只能用使用者給的資料完成任務,無法取得第一手環境資訊,而且每次仍需被交代上下文。員工狀態則能持續沉浸在組織中,主動感知會議、專案與業務動態。
感知環境時需要使用者提供上下文與關聯文件;理解目標時要靠明確意圖與約束;拆解任務時依賴規劃工具與行動鏈;最後以端到端任務交付為終點,再把偏好、經驗與工作流記錄下來。它能完成閉環,但閉環通常從「有人交代」才開始。
剛進場也需要專案背景與交接材料,卻會追問「到底要什麼」、自己排步驟並拆解執行路徑;完成工作後,還會把經驗帶進下一次任務。隨著脈絡與責任累積,可承接的範圍會越來越大,這才是終態 Agent 應追求的工作能力。
寫下理想 Agent 的成長性、動態邊界與工作流位置,作為指標取捨的北極星。
把完成、耗時、成本、品質、重試、請示與結果串回同一個真實任務。
保存「過去失敗但持續被嘗試」的需求;每逢模型、工具或權限升級就重測。
帶真實專案跑自己與競品,記錄付費、想切換、想分享三個關鍵時刻。
從成功定義、離線與線上評估到常見指標陷阱,建立可迭代的度量閉環。
雙人對談 · 繁體中文