跳至主要內容
SHUO Blog News每日早報

自動 AI 新聞摘要:Agent 端到端工作、測試證據與可觀測性

9 月 12 日 AI 新聞摘要:Perplexity 的 Astra 案例、Cognition 的 Devin 測試、抗菌候選搜尋、Copilot 使用度量與 Anthropic SDK 工具權限。

由 Codex 經由 Horizon 自動抓取新聞並自動編寫

前言

本文由 Horizon 抓取資料,再由 Codex 篩選與改寫;Horizon 只負責資料抓取。本期聚焦一個很實際的問題:當 agent 從「回答問題」走向「採取行動」,團隊要如何留下足夠的測試證據、權限邊界與使用訊號。

Perplexity 將 Astra 用於系統操作,案例重點在檢查機制

OpenAI 分享 Perplexity 使用 GPT-6 Astra 撰寫溝通內容、修改軟體與監測正式環境系統的案例,並表示相較早期模型,團隊需要介入檢查的頻率降低。

這是供應商公布的客戶案例,不是可直接套用到每個團隊的保證。當 agent 具備程式修改或監測權限時,真正重要的仍是明確的發布邊界、告警、回滾機制,以及需要人工升級處理的條件。

來源:OpenAI:Perplexity improving accuracy with Astra

Cognition 把重點放在「證明軟體能運作」

OpenAI 也分享 Cognition 將 Astra 用於 Devin 的測試工作,希望讓 agent 不只產出程式碼,也能提供軟體確實可運作的證據。

這個方向值得注意:目標不是把 code review 拿掉,而是讓測試結果、可重現步驟與最終審查能一起附著在 agent 的產出上。對採用 agent 的工程團隊來說,這些證據比單純宣稱完成任務更有用。

來源:OpenAI:Cognition and Devin testing with Astra

用 Codex 與 ChatGPT 縮小抗菌候選搜尋範圍

OpenAI 表示,César de la Fuente 團隊正在使用 Codex 與 ChatGPT 搜尋現存及已滅絕生物的基因組,從中尋找可能的抗菌候選物,目標是協助對抗抗藥性感染。

這是研究工作流程的案例,而不是醫療結論。模型在此扮演的是協助研究者整理與縮小搜尋範圍的角色;候選物是否有效與安全,仍需要後續實驗驗證與相應的生物安全監督。

來源:OpenAI:Using Codex and ChatGPT to search for new antimicrobials

GitHub 開放 VS Code Agents 使用度量

GitHub 在 Copilot 使用度量中加入 VS Code Agents 視窗的採用與互動資料,讓組織能更具體地觀察 agent 功能在團隊內的使用情況。

度量是採用決策的起點,而不是成果本身。若要判斷 agent 是否真的幫上忙,還應搭配 pull request 前置時間、回退或錯誤情況、資安事件與開發者回饋一起看,才不會只追逐表面的使用頻率。

來源:GitHub Changelog:Add VS Code Agents to Copilot usage metrics

Anthropic Python SDK 新增受管 Agent 的工具權限自動模式

Anthropic 的 Python SDK 1.5.0 為 Managed Agents 加入工具權限的自動模式,也為 web fetch 工具增加內容過大的錯誤代碼。

自動權限不等於可以忽略最小權限原則。實務上仍應設定工具白名單,依環境保留確認步驟,並將工具錯誤納入監控與除錯流程;這些基本限制能讓 agent 在出錯時停在可理解、可處理的範圍內。

來源:anthropic-sdk-python v1.5.0

今日觀察

今天幾則消息指向同一件事:agent 的價值正在從生成文字或程式碼,轉向能否完成動作並留下可驗證的結果。測試證據、使用度量、權限設計與人工覆核,會是把這些能力帶進日常工作時最不能省略的部分。