🔥 今日看点
- Slack 发布 Slack Code:Claude Code、Devin、Copilot 等编程 Agent 直接嵌入群聊频道,AI 编程从”一人一终端”走向”全员围观协作”
- 企业 Agentic AI 进入”信任竞赛”:Gartner 预测 40%+ 项目活不到 2028,赢家靠限制 Agent 自主性而非放任
- 智谱 GLM-5.3 上线 API:$1.4/$4.4 每百万 token 定价与上代持平,编码与长程 Agent 能力增强,权重待开源
- MCP 官方发布新路线图:Agent 身份与授权(DPoP/Workload Identity Federation)、服务端主动事件成五大优先方向
📰 模型与产品动态
1. Slack Code:把 AI 编程从终端搬进群聊
Salesforce 旗下 Slack 发布 Slack Code,将 Claude Code、Cognition Devin、GitHub Copilot、Vercel Agent 等编程 Agent 直接嵌入 Slack 频道——团队可在频道里围观、引导、审查并共同交付代码。Agent 被 @ 后自动创建项目专属代码频道,全程公开工作:代码 diff、实时预览、运行计划分标签展示,完成后归档并留下可检索的审计记录。同时推出 Agent DM、带实时状态与停止按钮的 Agents 标签页,以及一键”Add to Slack”接入(Lovable、n8n、OpenAI、LangChain、Airtable)。Cognition 透露内部合并 PR 数月增 10 倍而人数仅增 40%。
阅读全文
2. 企业赢家正在给 Agent”上锁”:自主性退潮,信任竞赛开启
VentureBeat 报道:真正从 Agentic AI 获益的企业,靠的是限制 Agent 能单独做的事,而不是给它们最大自由。Gartner 预测超过 40% 的 agentic AI 项目活不到 2028 年,主因是成本失控、业务价值不清、风控不足;McKinsey 2026 调查显示企业负责任 AI 成熟度平均仅 2.3/4。数千个号称 agentic 的产品中只有约 130 个具备真正自主能力。行业竞争正从”谁能部署最自主的 Agent”转向”谁能通过风控、法务与合规审批”的信任竞赛。
阅读全文
3. 智谱 GLM-5.3 上线 API:定价不变,权重待开源
z.ai 的 GLM-5.3 正式开放 API:输入 $1.4/百万 token、输出 $4.4/百万 token(与 GLM-5.2 持平),缓存输入 $0.26/百万,缓存存储限时免费。官方称编码与长程 Agent 任务表现显著增强,开发者可直接将 Agent 与应用接入。此前 GLM-5.3 以先进网络能力首秀,据称曾发现 Cursor 中一个此前未被发现的漏洞;模型权重计划开源,但具体日期与许可证尚未公布。当前 GLM Coding Plan 订阅用户仅限 OpenAI Chat Completions 兼容协议。
阅读全文
4. TrueFoundry 开源 Agent harness TrueForge:号称比 Claude Managed Agents 便宜 30%~75%
TrueFoundry 以 MIT 许可开源生产级 Agent harness TrueForge,主打”上下文工程”降本:延迟加载 MCP 工具 schema、隔离任务委派给子 Agent、超大工具结果落盘而非塞进上下文、50K token 自动压缩长会话;沙箱按需作为工具拉起而非全程包裹。官方基准:配 GLM-5.2 在 DevRev Enterprise-Bench 完成 11/14 任务,成本比 Claude Managed Agents + Opus 4.8 低 75%($2.90 vs $11.80);同用 Opus 4.8 也省约 30%。可本地 SQLite 起步,生产用 Docker Compose/Helm + Postgres/Redis 部署,配合其 AI Gateway 统一管控模型与 MCP 权限。
阅读全文
5. Block 开源桌面 Agent 工作区 Berd:跨模型跨 harness 的”每日 AI 工作台”
Jack Dorsey 旗下 Block 开源 Berd(Apache 2.0,v0.6.2,91 位贡献者):Tauri 2 + React 19 构建的本地桌面应用,通过 Agent Client Protocol(ACP)驱动 Goose sidecar,统一使用 Goose、Claude Code、Codex 等不同模型与 harness。本地优先存储会话历史与持久项目,界面刻意暴露加载/失败等运行状态而非”助手式友好”;还为不同 Agent 设计 Gloopies 角色形象(Berdy、Pushback、Choosey、Copycat 等)——“头像让它可识别,角色技能工具让它有用”。提供 macOS/Windows/Linux 免费构建。
阅读全文
6. MCP 发布新路线图:Agent 身份与授权成为下一阶段核心
Model Context Protocol 官方发布更新版路线图,划出五大优先领域:①长程 Agent 负载——服务端主动事件(webhook/channels,客户端无需轮询)与 Tasks 扩展(SEP-2663)成熟化;②统一传输——远程 MCP 服务器已等同普通 HTTP 负载(2026-07-28 版本),继续覆盖 stdio 上的 Streamable HTTP;③Agent 身份与授权——推进 DPoP、Workload Identity Federation 与企业托管授权,替代”粘贴 API key”;④工具调用结果契约统一 + 渐进式发现(百工具服务器不再全量预载);⑤SDK 易用性与规范一致性。相关 SEP 将获优先评审。
阅读全文 · HN 讨论
🌐 Hacker News 热门讨论
7. Munder Difflin:开源”克隆办公室”多 Agent harness(244 分)
GitHub Trending 当日第一的开源多 Agent harness:包装 Claude Code、Codex、Copilot、Cursor 等 12 种 CLI Agent,在你自己的机器上”运行一办公室你的克隆”,复用现有订阅(按小时限额),代码、密钥、订阅数据不出本机。提供”办公室”主题模拟界面监控 Agent(模拟是确定性的、不耗 token),团队版支持私有云 24/7 运行与 E2E 加密的克隆间自主通信。
官网 · HN 讨论
8. Autolith:带”活运行时”的 Common Lisp 编程 Agent(106 分)
终端内运行的编程 Agent:直接读写仓库文件、搜索工作区、执行命令与测试,内嵌 SBCL 运行时可供 Agent 实时检查、测试与扩展(Live Lisp);支持便携会话、记忆、议程、检查点与恢复,可对超长语料做递归推理。v0.35.0 覆盖 Linux/macOS/FreeBSD/NetBSD 多平台,默认模型 gpt-5.6-sol,可接 Grok、Fireworks AI、Anthropic 或任意 OpenAI 兼容端点。
官网 · HN 讨论
⭐ GitHub Trending 热门项目
9. openai/codex 领衔:终端编码 Agent 持续霸榜(113,356★)
OpenAI 的轻量终端编码 Agent(Rust 实现)继续高居 Trending,主打在终端内直接完成编码任务。同日榜上 anthropics/claude-code(142,534★)、n8n(201,811★)、makeplane/plane(57,220★)等 Agent/工作流基建项目依旧活跃——“终端 Agent + 工作流编排”仍是开源热度最高的两条主线。
仓库
10. Tencent/AI-Infra-Guard — 腾讯开源全栈 AI 红队平台(5,490★)
Python 实现的全栈 AI Red Teaming 平台:Agent Scan、Skills Scan、MCP Scan、AI 基础设施扫描一体,覆盖模型、技能、MCP 工具链与底层设施的安全审计。在 Agent 生态快速扩张、安全事件频发的当下,开源红队工具正成为企业 AI 治理的刚需基建。
仓库
11. cursor/plugins — Cursor 官方插件规范开源(4,660★)
Cursor 发布官方插件规范(TypeScript)与插件仓库:第三方可构建可复用的 Agent 技能/插件并接入 Cursor。IDE 厂商把 Agent 能力”插件化、生态化”,与 MCP 工具生态形成互补,是 AI 编程工具链走向开放平台的重要信号。
仓库
12. multica-ai/andrej-karpathy-skills — 把 Karpathy 的编码经验固化成 CLAUDE.md
将 Andrej Karpathy 对 LLM 编码的观察整理为单个 CLAUDE.md 文件,用于直接改善 Claude Code 行为。”把大神经验工程化、配置化”的玩法在 Trending 持续升温,折射出 Agent 工程正从提示词技巧走向可复用的经验资产。
仓库
📄 论文速递
13. MidTool:为 Agentic 工具调用合成中期训练数据
arXiv 新论文提出 MidTool:在预训练与后训练之间(mid-training)合成高质量工具使用数据,提升 LLM 的 Agentic 工具调用能力。随着工具调用成为 Agent 核心能力,数据合成路线正成为低成本提升模型工具能力的可行路径。
论文
14. Learning When to Think:自适应分配测试时计算
论文研究”何时该思考”的自适应推理:让模型按任务难度动态分配 test-time compute,避免简单问题过度推理、难题推理不足,为推理成本优化提供新思路,对 Agent 场景的 token 预算管理有直接参考价值。
论文
15. Pandora’s AI Model Routing Box:带成本价值估计的模型路由
提出在路由决策中显式估计各模型对当前请求的价值与成本,再做高效分配。与 Ramp Router、Snowflake Gateway 等厂商的模型路由产品化趋势相呼应——“让对的模型处理对的请求”正从工程技巧上升为系统化研究课题。
论文
本日报由 AI 自动整理,仅供参考。