2026年5月25日 星期一

今天學到了最有用的AI資訊

https://www.youtube.com/watch?v=PpeCur6fEXc 這部影片《我的 AI agent 連續跑了 27 個小時,/goal 功能怎麼用?》主要探討如何透過新功能與評估架構,讓 AI Agent 能夠長時間自動運行、不偏離目標,並產出符合人類品味的成果。 以下為影片的重點分析與整理: 一、 核心問題:AI 為什麼會偷懶? 上下文焦慮 (Context Anxiety): Anthropic 的研究指出,大語言模型(LLM)在執行任務時會監控自己的上下文視窗(Context Window),當發現快滿時就會產生焦慮,進而莫名其妙地開始草率收尾、假裝做完,這被稱為 AI 的「下班心態」[02:38]。 不完整的自動化: 如果把任務丟給 AI 後,人類每隔 10 分鐘還要回去檢查、調整方向,這並不是真正的自動化。真正的自動化是要解放人類的注意力 [00:20]。 二、 核心功能與原理:/goal 機制 多加公司推出官特(Official Feature): 包括 Cursor、OpenAI Codex、Hermes Agent 等工具近期都推出了名為 /goal 的新功能 [01:44]。 實作與評審的雙角色架構(Dual-Role Architecture): * 實作者: 負責執行指令、產出內容 [03:12]。 評審: 在每一輪結束後,根據用戶設定的目標檢查品質。只要尚未達成,評審就會點出問題並鞭策實作者繼續前進,直到抵達終點為止 [03:20]。 三、 如何設計一份高品質的 /goal 提示詞? 隨性、模糊的提示詞(例如「把專案改好一點」)會讓 AI 自行定義標準,通常產出不理想 [04:39]。一份好的提示詞必須包含以下 5 大關鍵元素 [05:28]: Outcome(成果): 明確定義任務完成時的最終狀態(例如:網站反應速度降到 0.2 秒以內)[05:31]。 Verification(驗證方式): 如何證明它真的達標(例如:使用速度測試工具驗證)[05:38]。 Constraint(限制條件): 哪些事情絕對不能做、範圍限制在哪 [05:42]。 Iteration Policy(迭代策略): 每一次嘗試之間,AI 需要記錄與嘗試什麼 [05:50]。 Error Handling(錯誤處理): 遇到什麼特殊狀況或卡住時必須暫停並向人類回報,避免無腦浪費 Token [05:56]。 四、 如何引導非程式類(主觀、直化)的工作? 對於像設計、寫作等偏向主觀品味的工作,不能靠單元測試,但可以參考 Anthropic 的做法,將模糊的概念拆解為明晰的維度(例如網頁設計拆成:設計品質、原創性、技術執行、可用性),並提高 AI 弱項的評分權重來矯正模型行為 [07:18]。在不斷迭代(Iteration)的對話中,AI 會出現「非線性」的創意飛躍 [09:22]。 五、 定義個人品味的 6 步驟 SOP 影片作者將如何把大腦中的主觀品味轉化為 AI 評審標準(Rubric)收斂成六個步驟 [10:24]: 測試基準線(Baseline): 先讓 AI 在沒有任何限制下隨便跑幾次,測試基本能力 [10:27]。 找出地雷點: 親自審視這些產出,把讓你「皺眉」的具體原因寫下來(例如:開頭太老套、缺乏具體數字)[10:45]。 分類維度: 將皺眉的理由收斂並分類成三大類(如:邏輯鬆散、缺乏人情味、開頭沒吸引力),作為 Rubric 的骨架 [11:15]。 提供具體案例(核心): 避免抽像描述,用絕對命令與經驗指名錯誤(例如:絕對不要用破折號、絕對不要寫「在這個快速變化的時代」)[12:06]。 確保多樣性(避免過度擬合): 提供多種可行的美學或風格方向供 AI 選擇,防止 AI 僵化複製單一範例 [13:13]。 餵給評審長時迭代: 將這份 Rubric 放進提示詞,讓 AI 評審以此標準不斷鞭策實作 Agent 執行,初期可人工對齊判斷標準,隨後即可完全放手 [13:54]。 總結 寫這份 Rubric 表面上是給 AI 用,實際上是逼迫人類把存在腦海中的模糊品味具體寫成文字 [14:53]。一旦文字化,AI 就能大規模幫你守住並執行它,讓你從 AI 的「協作者」升級為「AI 管理者」

沒有留言:

張貼留言