跳至主要內容
SHUO Blog News每日早報

自動 AI 新聞摘要:Agent 協作、即時語音與多模態 API

8 月 22 日 AI 新聞摘要:GitHub Copilot 進入 Slack 與 Teams、DeepSeek 視覺 API、低延遲 Qwen3-TTS,以及 LLM 與 OpenRouter CLI 更新。

由 Codex 經由 Horizon 自動抓取新聞並自動編寫

前言

本文由 Horizon 抓取資料,再由 Codex 篩選與改寫;Horizon 只負責資料抓取。

1. GitHub Copilot 在 Slack 開放 agentic 工作能力預覽

GitHub 將 Copilot CLI 與 Copilot app 的 agentic capabilities 帶進 Slack 的 GitHub integration,目前為 public preview。這讓團隊可以在既有溝通空間中與 @GitHub 協作,但導入前仍應確認頻道權限、可存取的儲存庫範圍與產出如何回到正常的 review 流程。

資料來源:GitHub Changelog:The new GitHub Copilot experience in Slack

2. GitHub Copilot 也能在 Microsoft Teams 共享 agent session

GitHub 在 Microsoft Teams 推出 shared agentic work。使用者可在 channel、thread 或 direct message 提及 @GitHub,啟動讓多人共同觀看與引導的 Copilot 工作階段。這類協作方式能讓需求釐清和 agent 執行留在同一條討論脈絡,但最終修改仍需要明確的審核責任。

資料來源:GitHub Changelog:Shared agentic work with GitHub Copilot in Microsoft Teams

3. DeepSeek 推出 v4 Flash Vision 實驗版

DeepSeek 發布 v4 Flash Vision 實驗版的視覺指南。資料指出,圖片會依尺寸轉成 token 並與文字 token 一起計費;在推論前,圖片會保留長寬比自動縮放,較大圖片會縮至約 800×800 的總像素量。需要 OCR 或文件理解的產品,應先以自己的頁面與字級測試縮放後的辨識品質和成本。

資料來源:DeepSeek:v4 Flash Vision experimental guide

4. Qwen3-TTS 的實作報告目標是 sub-50ms 首段音訊

Nari Labs 分享 Qwen3-TTS 的延遲優化,表示在一張 H100、每秒 10 個請求下,p95 time-to-first-audio 可達 34ms,並公開實作、benchmark 與優化說明。即時語音體驗不只取決於語音品質,首段音訊延遲、併發量與硬體成本也要一起衡量;這份數字應視為特定條件下的基準,而非所有部署都能直接複製。

資料來源:Nari Labs:How we made a text-to-speech model respond in sub-50 ms

5. LLM 與 llm-openrouter 更新,處理相依與工具呼叫

LLM 0.32.1 暫時將 openai<3 固定,修正 fresh install 因 transitive httpx 相依消失而失效的問題,後續版本預計改用 httpx2。llm-openrouter 0.7 則改用 OpenRouter 的 Responses API,並新增 Shell、WebFetch 與 WebSearch 三個 server-side tools。這些更新提醒 CLI agent 專案:相依更新和工具權限都需要被視為正式的版本升級工作。

資料來源:Simon Willison:llm 0.32.1llm-openrouter 0.7

今日觀察

今天的趨勢不是單純讓 agent 更會回答,而是把它帶進協作工具、語音介面與多模態工作流。真正的品質門檻,仍在權限、成本、延遲與最終審核能否被清楚管理。