2026年5月25日 星期一
今天學到了最有用的AI資訊
https://www.youtube.com/watch?v=PpeCur6fEXc
這部影片《我的 AI agent 連續跑了 27 個小時,/goal 功能怎麼用?》主要探討如何透過新功能與評估架構,讓 AI Agent 能夠長時間自動運行、不偏離目標,並產出符合人類品味的成果。
以下為影片的重點分析與整理:
一、 核心問題:AI 為什麼會偷懶?
上下文焦慮 (Context Anxiety): Anthropic 的研究指出,大語言模型(LLM)在執行任務時會監控自己的上下文視窗(Context Window),當發現快滿時就會產生焦慮,進而莫名其妙地開始草率收尾、假裝做完,這被稱為 AI 的「下班心態」[02:38]。
不完整的自動化: 如果把任務丟給 AI 後,人類每隔 10 分鐘還要回去檢查、調整方向,這並不是真正的自動化。真正的自動化是要解放人類的注意力 [00:20]。
二、 核心功能與原理:/goal 機制
多加公司推出官特(Official Feature): 包括 Cursor、OpenAI Codex、Hermes Agent 等工具近期都推出了名為 /goal 的新功能 [01:44]。
實作與評審的雙角色架構(Dual-Role Architecture): * 實作者: 負責執行指令、產出內容 [03:12]。
評審: 在每一輪結束後,根據用戶設定的目標檢查品質。只要尚未達成,評審就會點出問題並鞭策實作者繼續前進,直到抵達終點為止 [03:20]。
三、 如何設計一份高品質的 /goal 提示詞?
隨性、模糊的提示詞(例如「把專案改好一點」)會讓 AI 自行定義標準,通常產出不理想 [04:39]。一份好的提示詞必須包含以下 5 大關鍵元素 [05:28]:
Outcome(成果): 明確定義任務完成時的最終狀態(例如:網站反應速度降到 0.2 秒以內)[05:31]。
Verification(驗證方式): 如何證明它真的達標(例如:使用速度測試工具驗證)[05:38]。
Constraint(限制條件): 哪些事情絕對不能做、範圍限制在哪 [05:42]。
Iteration Policy(迭代策略): 每一次嘗試之間,AI 需要記錄與嘗試什麼 [05:50]。
Error Handling(錯誤處理): 遇到什麼特殊狀況或卡住時必須暫停並向人類回報,避免無腦浪費 Token [05:56]。
四、 如何引導非程式類(主觀、直化)的工作?
對於像設計、寫作等偏向主觀品味的工作,不能靠單元測試,但可以參考 Anthropic 的做法,將模糊的概念拆解為明晰的維度(例如網頁設計拆成:設計品質、原創性、技術執行、可用性),並提高 AI 弱項的評分權重來矯正模型行為 [07:18]。在不斷迭代(Iteration)的對話中,AI 會出現「非線性」的創意飛躍 [09:22]。
五、 定義個人品味的 6 步驟 SOP
影片作者將如何把大腦中的主觀品味轉化為 AI 評審標準(Rubric)收斂成六個步驟 [10:24]:
測試基準線(Baseline): 先讓 AI 在沒有任何限制下隨便跑幾次,測試基本能力 [10:27]。
找出地雷點: 親自審視這些產出,把讓你「皺眉」的具體原因寫下來(例如:開頭太老套、缺乏具體數字)[10:45]。
分類維度: 將皺眉的理由收斂並分類成三大類(如:邏輯鬆散、缺乏人情味、開頭沒吸引力),作為 Rubric 的骨架 [11:15]。
提供具體案例(核心): 避免抽像描述,用絕對命令與經驗指名錯誤(例如:絕對不要用破折號、絕對不要寫「在這個快速變化的時代」)[12:06]。
確保多樣性(避免過度擬合): 提供多種可行的美學或風格方向供 AI 選擇,防止 AI 僵化複製單一範例 [13:13]。
餵給評審長時迭代: 將這份 Rubric 放進提示詞,讓 AI 評審以此標準不斷鞭策實作 Agent 執行,初期可人工對齊判斷標準,隨後即可完全放手 [13:54]。
總結
寫這份 Rubric 表面上是給 AI 用,實際上是逼迫人類把存在腦海中的模糊品味具體寫成文字 [14:53]。一旦文字化,AI 就能大規模幫你守住並執行它,讓你從 AI 的「協作者」升級為「AI 管理者」
訂閱:
張貼留言 (Atom)
沒有留言:
張貼留言