🔥 今日看点

  • Google 发布 Gemini 3.7 Flash:距 3.6 仅三周即迭代,主打编码与 Agent 工作负载,API 价格限时减半($0.75/$3.75 每百万 token,2027 年 1 月恢复 $1.50/$7.50)
  • DeepSeek 官宣 V4-Pro 正式版 + 开源 Agent 框架 Harness v0.1(MIT 许可,”一切皆插件”架构对标 Claude Code/Codex),同时取消统一 API 定价改为峰谷计费
  • Cerebras 与 OpenAI 合作推出 GPT-5.6 Sol Ultrafast Mode:最高 750 输出 token/秒、无质量损失,HLE 2500 题 11 小时跑完(Claude Fable 5 需 78 小时)
  • Writer 发布基于 GLM-5.2 后训练的 Palmyra X6(744B MoE):Agent 成本降 52%、速度提升 48%,仅用 626 条合成轨迹完成微调

📰 VentureBeat 精选

1. Google 发布 Gemini 3.7 Flash:编码与 Agent 为核心,API 价格限时减半

Google 推出 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周(官方归因于开发者反馈与算法改进),定位”最智能的工作马模型”,重点强化编码、Agent 工作流与知识工作。官方称模型”思考更勤勉”:多步规划与工具调用投入更多精力,遇阻时更好适应、澄清意图、更严格遵循指令,目标是以更少重试和人工监督完成执行;DeepMind 表示在调试、问题修复、Web 布局生成上均有提升。API 价格至 2026 年底限时减半:$0.75/百万输入、$3.75/百万输出,2027 年 1 月 1 日起恢复 $1.50/$7.50——给高吞吐编码与业务 Agent 留出数月的评估窗口。值得注意的是 3.5 Pro 仍无发布日期,Flash 线成为 Google 快速迭代主力。
阅读全文 · Google 官方博客 · HN讨论

2. DeepSeek 发布 V4-Pro 正式版 + Harness v0.1 开源 Agent 框架

DeepSeek 同步官宣两件事:一是 DeepSeek-V4-Pro 正式版,聚焦 Agent 负载,已上线网页、App 与 API,原生支持 OpenAI Responses API 并集成 Codex;二是开源 Agent 框架 DeepSeek Harness v0.1(命令行 dsh,MIT 许可,npx @deepseek-ai/dsh web 可启动),基于 Cordis 插件框架构建,核心理念”一切皆插件”——模型、工具、技能、会话、沙箱、文件系统、循环、编排与 UI 均可替换,已支持仓库检视、文件编辑、shell 执行、搜索、规划、子 Agent 委派与审批策略。官方明确标注为 developer preview,会有破坏性变更。同时 DeepSeek 宣布 8 月 16 日起放弃统一 API 定价,改为峰谷计费,即便谷时价格也将高于现行价——模型竞争正从 token 单价转向 Agent 工具链与运行时层。
阅读全文 · Harness 官方页 · HN讨论

3. Writer 发布 Palmyra X6:基于 GLM-5.2 后训练,Agent 成本降 52%

企业 Agent 平台 Writer 发布旗舰模型 Palmyra X6:744B 参数 MoE(约 40B 激活),架构继承自智谱 Z.ai 的开源 GLM-5.2,Writer 在技术报告中公开披露并强调”完全运行在美国基础设施上”。其训练配方相当克制:用”锚定监督微调(ASFT)”仅以 626 条合成 Agent 轨迹、单 epoch、低学习率微调,配合 KL 散度锚点防止偏离基座能力,并将优化器换成 Muon。官方称 Agent 产品平均成本降 52%、速度提升 48%、质量提升 10%,同时发布重构的 Agent 编排 harness 与治理工具,直击企业 token 支出失控问题——Goldman Sachs 预测 2026-2030 年 token 消耗将增长 24 倍至每月 120 万亿。
阅读全文

4. SpaceXAI 的 Grok Bot:$120/月”持久数字同事”可操作你的应用

SpaceXAI 推出 Grok Bot 订阅服务($120/月):将计算机操作、持久记忆、工作流学习与多 Agent 协调打包成”劳动力界面”式的数字同事,可长期驻留并操作应用。与单纯证明”AI 能操作软件”不同,其差异化在于把持久化与多 Agent 协作产品化,被视为 Agent 从工具走向”员工”形态的又一信号。
阅读全文


🌐 Hacker News 热门讨论

5. Cerebras × OpenAI:GPT-5.6 Sol Ultrafast Mode,最高 750 token/秒(420 分)

Cerebras 与 OpenAI 公布 Ultrafast Mode 早期预览:这是 OpenAI API 中由 Cerebras 硬件驱动的新服务层级,首批面向精选客户开放。GPT-5.6 Sol 在 Ultrafast 模式下最高输出 750 token/秒且无质量损失,据 Artificial Analysis 数据比 Claude Fable 5 快 11 倍、比 Opus 4.8 Fast 模式快 5 倍。Cerebras 实测 Humanity’s Last Exam 全部 2500 题仅用 11 小时 11 分跑完(准确率相当),而 Claude Fable 5 用了 78 小时 27 分——“一个工作日跑完人类知识前沿”。推理速度正成为前沿模型的新竞争维度。
官方博客 · HN讨论

6. Mistral OCR 4.1:段落级边界框与结构块标签(252 分)

Mistral 发布 OCR 4.1,支撑其 Document AI 栈的最新 OCR 服务:原生段落级边界框提取、结构块标签与块级置信度分数,定价 €3.5/千页(带标注 €4.38/千页)。相比逐行输出的传统 OCR,结构感知抽取直接服务于 RAG 与文档 Agent 的下游解析,是文档智能管线的重要升级。
文档页 · HN讨论

7. Launch HN:Bullet(YC S26)——更快的编码 Agent(84 分)

YC S26 项目 Bullet 发布,定位”更快的编码 Agent”,登上 HN(84 分)。在 Claude Code/Codex/Harness 密集发布的当周,编码 Agent 的”速度与成本”成为新卖点,社区围绕 Agent 延迟、token 消耗与长任务稳定性展开讨论。
产品页 · HN讨论


8. cathrynlavery/diagram-design — Claude Code 图表设计库(今日 +4,475)

“29 种编辑级图表类型,专为 Claude Code 打造”,自包含 HTML + SVG,无需 Mermaid。总星 14.7k、今日 +4,475,连续两日霸榜。编码 Agent 的交付物质量(图表/文档呈现)正成为新的竞争维度。
仓库

9. macro-inc/macro — 共享 AI 记忆的统一工作空间(今日 +1,239)

面向团队的统一工作空间:邮件、聊天、文档、任务、Agent、通话与 CRM 通过”@关联 + 共享 AI 记忆”串联。总星 2.6k、今日 +1,239。Agent 时代的”团队 OS”形态开始浮现。
仓库

10. cactus-compute/needle — 14MB 端侧基础模型(今日 +769)

仅 14MB 的基础模型,面向手机、可穿戴、智能家居与机器人等微型设备,今日 +769 星(总星 5k)。端侧微型模型与边缘 Agent 部署持续升温。
仓库

11. NVIDIA-NeMo/Switchyard — 跨模型流量路由层(今日 +408)

NVIDIA NeMo 发布 Switchyard:让 LLM 应用在模型与供应商之间路由流量,同时保持原生 OpenAI/Anthropic API 兼容,支持灵活的多模型切换与降级策略。模型可替换性(model portability)正成为基础设施标配。
仓库

12. unslothai/unsloth — 本地训练/运行 LLM 的统一 UI(今日 +328)

unsloth 推出本地 UI,可运行与微调 LLM 及扩散模型,支持 Qwen3.8、Kimi K3、MiniMax-H3、Gemma 4、DeepSeek-V4、FLUX 等。总星 71k、今日 +328。本地模型生态的”一站式入口”竞争加剧。
仓库

13. kepano/obsidian-skills — Obsidian 的 Agent 技能(今日 +292)

Obsidian CEO kepano 发布 Agent Skills 集合:教 Agent 使用 Obsidian CLI 与开放格式(Markdown、Bases、JSON Canvas)。总星 45.8k、今日 +292。个人知识库正批量接入 Agent 生态。
仓库

14. infiniflow/ragflow — 开源 RAG 引擎持续领跑(今日 +465)

RAGFlow 持续上榜:融合 RAG 与 Agent 能力的开源检索增强生成引擎,总星 88k、今日 +465。文档解析(结合 OCR 4.1 类能力)与 Agent 检索的融合仍是企业落地主线。
仓库


本日报由 TimLake AI 编辑自动采集整理,数据来自 VentureBeat、Hacker News、GitHub Trending 等公开来源。