🔥 今日看点

  • DeepSeek 发布开源 Agent Harness v0.1(MIT 协议,GitHub 已 11.5 万星),主打”一切皆插件”,正面对标 Claude Code 与 Codex;旗舰模型 V4-Pro 官方版同步上线,8/16 起 API 改峰谷定价、整体涨价
  • Google 发布 Gemini 3.7 Flash:距 3.6 Flash 仅三周,定位”编码与 Agent 最强工作马模型”,API 半价促销(输入 $0.75/百万 token),FrontierCode 1.1 达 43.6% 反超 Claude Sonnet 5
  • SpaceXAI 推出 Grok 4.6:Artificial Analysis 综合排名升至全球第三(超越 Kimi K3、追平 GPT-5.6 Sol),长时运行 Agent 能力大幅增强;同日发布月费 $120 的 Grok Bot 持久化数字同事
  • HN 热帖:开发者用 Codex 做”自动研究”将内核提速 232 倍(388 分);”AI 工作记忆远超人脑”(389 分)引发推理本质之争

📰 模型与产品动态

1. DeepSeek Harness v0.1 开源:Agent 运行时”一切皆插件”

DeepSeek 正式发布开源 Agent Harness(dsh,MIT 协议,GitHub 已获 11.5 万星),基于 Cordis 框架构建,模型、工具、技能、会话、沙箱、文件系统、编排与 UI 全部可插拔替换,支持仓库检视、文件编辑、Shell 执行、子代理委派与审批策略,可用 npx @deepseek-ai/dsh web 直接启动。官方明确标注为开发者预览版(”将有破坏性兼容变更”)。同日上线的 V4-Pro 官方版聚焦 Agentic 工作负载,原生支持 OpenAI Responses API 并集成 Codex;但 8/16 16:00 UTC 起 API 改为峰谷定价,即便谷时折扣价也高于现价。DeepSeek 正从”模型层”向”Agent 基础设施层”延伸。
阅读全文 · GitHub

2. Google 发布 Gemini 3.7 Flash:三周迭代,半价主打编码与 Agent

距 Gemini 3.6 Flash 发布仅三周,Google 推出 3.7 Flash,官方称其为”编码与 Agent 最智能的工作马模型”:更善于遇阻调整、澄清意图、忠实执行指令,减少重试与人工干预。编码成绩大幅跃升——FrontierCode 1.1 Main 43.6%(3.6 为 34.4%,超 Claude Sonnet 5 的 42.7%)、DeepSWE v1.1 65.3%(3.6 为 49.0%)、企业流程自动化 AutomationBench 30.4%(3.6 仅 17.0%)。API 端到 2026 年底促销半价:$0.75/百万输入 token、$3.75/百万输出 token,明年 1 月起恢复 $1.50/$7.50。以低价位抢占高频编码与业务 Agent 场景意图明显,但 Google 自家榜单显示其并未全面碾压高价竞品。
阅读全文

3. SpaceXAI 发布 Grok 4.6:Artificial Analysis 全球第三

Grok 4.6 正式亮相:在 Artificial Analysis 综合榜单上超越 Kimi K3、追平 GPT-5.6 Sol,位居全球第三。相较前代,长时运行 Agent 行为显著增强,推理与工具调用稳定性提升。官方强调其价值不在”单项第一”,而在以接近前沿的智能水平 + 更强的持久化 Agent 能力切入企业场景,与 Grok Bot 形成”模型 + 数字员工”组合拳。
阅读全文

4. Writer Palmyra X6:Agent 成本直降 52%

Writer 发布新模型 Palmyra X6:其 Agent 产品搭配该模型后平均成本降低 52%、速度提升 48%、质量提升 10%。在 token 支出激增的背景下,企业 AI 的核心矛盾正从”能力”转向”单位任务的成本与速度”,Palmyra X6 通过更高效的推理与更少的重试实现降本,是”降本增效”叙事的最新样本。
阅读全文

5. Grok Bot:$120/月的”持久化数字同事”

SpaceXAI 同步推出 Grok Bot:把 Agent 变成可长期驻留、持续操作你应用的”数字同事”,月费 $120。与一次性对话式 Agent 不同,它强调跨会话记忆与自主执行,被视为”Agent 即员工”商业模式的开端,也引发关于权限边界与自动化安全的讨论。
阅读全文

6. LTX-2.5 开源:单图生成 10 秒视频仅需 6.8 秒

开源视频生成模型 LTX-2.5 发布:在 Nvidia 超算芯片上,从单张图片生成 10 秒视频只需 6.8 秒,开放权重、可本地部署。视频生成在”速度 + 开源”两个维度同时拉满,为内容生产工作流提供了低延迟、可自托管的替代方案。
阅读全文


🌐 Hacker News 热门讨论

7. 用 Codex 做”自动研究”:内核提速 232 倍(388 分)

开发者分享用 Codex 进行自动研究的实战:AI 自主分析、实验、迭代,最终将内核性能提升 232 倍。评论区围绕”Agent 自主科研的边界”展开——有人认为这是编码 Agent 从”写代码”升级为”做研发”的标志性案例,也有人质疑基准选择与可复现性。无论结论如何,Auto-research 已成为 Agent 产品的新战场。
原文 · HN讨论

8. AI 不是更会推理,而是”记性”更好(389 分)

一篇登顶 HN 的观点文章引发热议:AI 解数学难题的优势可能并非推理更强,而是拥有近乎无限的符号化工作记忆(上下文窗口)——能同时容纳整个问题、数百条中间推导与多种被放弃的思路,而人脑工作记忆容量极其有限。作者认为”机器放大的冯·诺依曼”比”电子爱因斯坦”更贴切。对 Agent 产品设计而言,上下文管理即”记忆管理”,正在成为核心工程问题。
原文 · HN讨论

9. “和 AI 协作更像带团队,而不是写代码”(258 分)

前创业公司 CEO Allen Bargi 撰文:把 AI 当编译器用会不断受挫,把它当协作者才能发挥价值——好的领导者分享上下文、说明期望结果、设定边界并回应反馈,这些习惯同样适用于与 AI 协作。CLAUDE.md、示例与可复用指令比”完美提示词”更重要。评论区共鸣强烈:”提示工程正在变成管理科学”。
原文 · HN讨论


10. cathrynlavery/diagram-design — Claude Code 图表设计(今日 +1,607,总 18.6k)

为 Claude Code 提供 29 种编辑级图表类型,自包含 HTML + SVG,宣称”无阴影、无 Mermaid 味”。AI 生成图表的”设计品味”正在成为 Agent 输出质量的新竞争点。
仓库

11. cactus-compute/needle — 14MB 端侧基础模型(今日 +547,总 6.1k)

专为手机、可穿戴、智能家居与机器人设计的 14MB 基础模型,主打超低资源占用下的端侧推理。端侧小模型赛道持续升温,边缘 Agent 的”大脑”越来越轻。
仓库

12. MakazhanAlpamys/Soup — 一个 YAML 微调 LLM(今日 +297,总 1.7k)

从单个 YAML 文件微调 LLM:分层流式训练让 8B 模型可在 4GB 显存的笔记本 GPU 上训练。把”微调”的门槛降到配置文件级别,个人开发者本地训练的门槛再次降低。
仓库

13. cordiverse/cordis — DeepSeek Harness 底层框架(今日 +599,总 4.1k)

“时空可组合性元框架”,正是 DeepSeek Harness 的构建基础,随 Harness 发布同步冲榜。插件化 Agent 运行时架构成为开源社区的新共识。
仓库

14. cursor/plugins — Cursor 官方插件规范(今日 +149,总 3.0k)

Cursor 公布插件规范与官方插件仓库,为 IDE 级 Agent 引入可扩展插件体系。编码 Agent 正在复制编辑器生态的”插件化”路径,生态位竞争加剧。
仓库


📚 arXiv 新论文速览

15. vToken:可回收 KV 缓存的 Token 级虚拟化

vToken 提出 Token 级虚拟化方案,让 KV 缓存可被回收复用,直击长上下文与多会话 Agent 场景的显存瓶颈;同日还有开源临床多智能体框架 MARC v1(医学推理与协调)与 Agent Harness 组合修复研究值得关注。
论文列表


本日报由 AI 自动整理,仅供参考。