Yeekal Logo Yeekal
4,910 字
早报 | MORNING 2026-07-25

Anthropic 发布 Claude Opus 5,黄仁勋首条推文联合支持开源模型

今日要点
  • Anthropic 发布 Claude Opus 5,基准匹配 Fable 5,定价减半
  • 黄仁勋首条推文联合数十家科技巨头公开支持开源模型
  • 美团开源万亿参数 LongCat-2.0,同步开放国产卡推理栈
上一期 · 2026-07-24 已是最新一期
Anthropic 今日发布 Claude Opus 5,定价 $5/$25 per M tokens,在 Frontier-Bench、ARC-AGI 3 等基准上匹配或超越旗舰 Fable 5,发布数小时内获 Cursor、GitHub Copilot 等十余家平台集成。同日,NVIDIA 黄仁勋在 X 发布首条推文,联合微软、Meta、Hugging Face 等数十家公司签署公开信,力挺开放权重模型。美团正式开源 LongCat-2.0 万亿参数 MoE 权重及国产芯片推理代码。

title: “Anthropic 发布 Opus 5,NVIDIA 领衔科技巨头联名支持开源模型” lead: “Anthropic 发布 Claude Opus 5,智能接近 Fable 5 但定价仅为其一半;黄仁勋在 X 发布首条推文,联同微软、Meta 等数十家公司签署公开信支持开源模型;美团正式开源 1.6T 参数 LongCat-2.0 及国产芯片推理代码。” highlights:

  • “Anthropic 发布 Claude Opus 5,多项基准超越 Fable 5,定价减半”
  • “NVIDIA 黄仁勋领衔公开信支持开源模型,Sam Altman、纳德拉等响应”
  • “美团开源万亿参数 LongCat-2.0,同步开放国产卡推理代码”

1️⃣ [持续跟踪] Anthropic 发布 Claude Opus 5:接近 Fable 5 的智能,一半的价格#

  • 前情提要:Anthropic 在 6 月 9 日发布了最强旗舰模型 Fable 5,定价为史上最贵;同时其安全版本 Mythos 5 仅向少数合作伙伴开放。
  • 最新突破:Anthropic 官方今日正式发布 Claude Opus 5,定位为”新 SOTA 的 Opus 模型”。在 Frontier-Bench、CursorBench、ARC-AGI 3 等多个基准测试中匹配甚至超越 Fable 5,但 API 定价保持不变(输入 5/M,输出5/M,输出 25/M),仅为 Fable 5 价格的一半。模型已在 Claude Max/Pro、API(claude-opus-5)及 Fast 模式中上线。
  • 广泛集成:发布后数小时内,Cursor、GitHub Copilot、Vercel AI Gateway、Devin、Lovable、Notion、v0、AI SDK、OpenRouter、Perplexity、Recraft 等十余个主流平台相继宣布集成支持。
  • 关键性能:CursorBench 匹配 Fable 5(66.7 vs 66.5);ARC-AGI-3 得分 30.2%,是此前所有模型(未达 1%)的 30 倍以上;Zapier AutomationBench 任务通过率约为第二名 1.5 倍;在几项基准测试中最大 reasoning 模式出现部分性能退化,引发社区关注。
  • 安全与对齐:系统卡显示为目前最难以提示注入的模型,在 Claude Code 中结合多层防御后攻击成功率接近 0%。 🔗 Anthropic 官方公告 | Cursor 集成 | GitHub Copilot 集成 | AWS 博文

2️⃣ NVIDIA 黄仁勋领衔公开信支持开源模型,Sam Altman、纳德拉等巨头响应#

  • 核心亮点:NVIDIA CEO 黄仁勋今日在 X 发布其首条推文,分享了一封由 NVIDIA、Microsoft、Hugging Face、Meta、Replit、Perplexity、Mistral 等数十家公司签署的公开信,力挺开放权重模型在 AI 生态中的重要性。信中强调开放模型能”增强安全、加速创新、实现主权”。
  • 关键响应:Sam Altman 表示”希望美国在开源和闭源 AI 中均获胜”;Satya Nadella 发文称”开放权重模型对健康的 AI 生态至关重要”;Mark Zuckerberg、LangChain CEO、Hugging Face CEO/CTO、Ollama、lmarena 等均表达支持。Perplexity CEO 和 Replit CEO 更是直接宣布已联合签署该信。
  • 政治背景:此举正值美国政府内部就是否应限制中国开源模型的广泛讨论之际,信中明确呼吁”不要因潜在风险过早限制开源模型”。多家头部公司的集体表态标志着硅谷对开源 AI 监管问题的统一立场。
  • 行业意义:当全球最大的 AI 算力基础设施供应商公开为开源模型站台,这不仅是资本对开放生态的背书,更意味着开源模型已从技术选择升级为关乎国家竞争力和产业扩散的战略级议题。 🔗 Jensen Huang 首条推文 | Sam Altman 响应 | Satya Nadella 响应 | 公开信全文

3️⃣ [持续跟踪] 美团 LongCat-2.0 正式开源:同步开放国产卡推理代码#

  • 前情提要:美团于 6 月 30 日发布 LongCat-2.0,这是业界首个在五万卡国产算力集群上完成全流程训练的万亿参数 MoE 模型(1.6T 总参数,48B 平均激活),已于 OpenRouter 上跻身全球调用量前三。
  • 最新突破:美团今日正式全面开源 LongCat-2.0,包含 BF16/FP8/INT8 等多精度权重和针对国产芯片(NPU)的极致优化推理代码。同步开源长期动态用户建模基准 VitaBench 2.0 和交互式世界模型评测基准 WBench。
  • 技术特色:架构引入 LongCat Sparse Attention(百万级上下文)、ScMoE(token 级动态激活)、MOPD 多专家融合(Agent/Reasoning/Interaction 三组专家)。在国产芯片上通过 Super Kernel 和 Weight Prefetch 实现万亿参数模型低延迟推理。
  • 行业意义:这是首个完整开源”万亿参数模型+国产卡推理栈”的项目,验证了国产芯片承载前沿模型的能力。开源代码使存量国产算力可直接复用,对国内自主 AI 基础设施建设具有标杆意义。 🔗 美团技术博客 | HuggingFace 权重 | GitHub 推理代码

4️⃣ NVIDIA ModelExpress 将 DeepSeek-V4 Pro 启动时间从 8 分钟降至 2 分钟#

  • 核心亮点:NVIDIA AI 今日宣布,通过 ModelExpress (MX) 将 DeepSeek-V4 Pro 模型的启动时间从此前的 8 分钟大幅缩短至 不到 2 分钟
  • 技术原理:核心是通过 GPU 间 RDMA 直接将权重传输至 GPU 显存,避免了传统集中式广播的瓶颈。同一技术还加速了推理和强化学习后训练,通过复用 kernel 缓存,推理 worker 可直接从其他 GPU 获取更新后权重,使权重迁移不占用推理关键路径。
  • 行业意义:模型越大,加载和切换成本越高。ModelExpress 解决的是大模型在动态业务场景下的”冷启动”痛点,使模型调度更加敏捷。这项技术将对大规模模型推理的弹性伸缩和成本控制产生直接影响。 🔗 NVIDIA AI 推文 | 技术深度博文

5️⃣ Kimi K3 在 Code Arena 超越 Fable 5,居 6/7 前端领域榜首#

  • 核心亮点:lmarena.ai 今日公布数据显示,Kimi K3 在发布仅 6 周后便在 Code Arena 上超越 Fable 5,以 1679 Elo 的成绩在 7 个前端领域中的 6 个排名第一。Cognition 首席科学家在一段访谈中分析了这一结果,指出 Kimi K3 以 15输出成本的价格完成了Fable515 输出成本的价格完成了 Fable 5 需 50 的任务。
  • 智能指数排名:Artificial Analysis 数据显示,Kimi K3 max 的智能指数达到 57 分,落后于 Fable 5(60)和 GPT-5.6 Sol(59),但成本仅为 Fable 5 的约三分之一。
  • 行业意义:Kimi K3 在代码场景的性价比优势极为突出。这进一步验证了”模型路由”策略的合理性,也促使 Anthropic 和 OpenAI 加速推出更高性价比的产品(如今天发布的 Opus 5)。 🔗 lmarena.ai 推文 | Artificial Analysis 数据

6️⃣ Google 发布 OKF v0.2:为 AI Agent 生态添加可信溯源层#

  • 核心亮点:Google Cloud 今日发布 Open Knowledge Format v0.2,在保留 v0.1 最小化理念的基础上,新增”信任信号”体系。新版本允许一个知识 bundle 内嵌 provenance(sources)、trust(generated/verified)、freshness(stale_after)、lifecycle(status)和 attestation(可验证的计算)等五大类字段。
  • 关键设计:新增 Attested Computation 概念类型,允许代理声明并验证一个数值是否按指定 SQL/API 计算。该验证由确定性无 LLM 的 attester 完成,而非依赖模型判断。
  • 行业意义:当 Agent 开始自主生成和消费大规模知识库时,信任成为核心瓶颈。OKF v0.2 提供了一种标准化、非专有的方法来回答”谁能信任哪个 Agent 创建的哪条知识”,这可能是 Agent 从”好玩”走向”可信”的关键基础设施。 🔗 Google Cloud 博客 | GitHub 仓库

7️⃣ Microsoft 开源 Fara1.5-27B:可本地部署的电脑操作 Agent#

  • 核心亮点:Microsoft 今日开源 Fara1.5-27B,一个基于 Qwen3.5 架构的 27B 参数电脑操作 Agent。该模型专门面向 computer-use 场景,能像人一样浏览网页、填写表单、从截图中提取数据并操作按钮。
  • 模型能力:27B 参数规模使其具备实用网页自动化能力,同时可以本地部署和自托管,显著降低了电脑操作 Agent 的部署门槛。模型权重已在 Hugging Face 开放。
  • 行业意义:此前能够可靠操作电脑的模型通常很大、昂贵且闭源。Fara1.5-27B 证明中等规模的开源模型已能胜任真实网页任务,这将推动 RPA(机器人流程自动化)和数字助手从付费服务向自托管、自由定制的方向演进。 🔗 Berryxia 推文 | HuggingFace Models 引用

8️⃣ Darwin 发布开源自动路由模型:降低 70% 的 Agent 编码成本#

  • 核心亮点:Daridotdev 今日宣布发布其开源的自动路由模型。该模型是一个经过代理场景训练的小型 SLM,嵌入在 Claude Code、Codex 等 harness 中实现缓存感知的模型切换,可在不降低编码性能的前提下将 Agent 成本降低约 70%
  • 关键技术:路由决策是”缓存感知”的,只有当切换到更便宜模型确实能省钱时才切换,避免了因切换模型导致 prompt cache 失效而带来的隐性成本。
  • 行业意义:模型路由的痛点之一就是缓存失效带来的隐形开销。Darwin 的路由器以 SLM 运行,意味着路由决策本身的开销极低,这为 Agent 成本优化提供了一个切实可行的、可直接嵌入现有 harness 的解决方案。 🔗 omarsar0 转引 | Avyay Varadarajan 宣布

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
mattpocock/skillsAI Agent186.7k
Lordog/dive-into-llms模型/培训45.0k
OtterMind/Chat2DBAI 工具26.3k

1. mattpocock/skills ⭐ 今日 +2251#

语言/许可: Shell / MIT
总 Stars: 186.7k
仓库: GitHub

项目定位:
为 AI 编码代理(Claude Code、Codex 等)提供的可组合技能集,用于解决 AI 辅助开发中的常见失效模式——需求对齐、沟通冗余、缺乏反馈循环、代码熵加速。

核心功能:

  • /grill-me / /grill-with-docs:需求对齐技能,强制代理在编码前通过结构化提问澄清需求,并通过构建领域术语表(CONTEXT.md)压缩沟通成本。
  • /tdd:测试驱动开发技能,引导代理执行红-绿-重构循环,通过自动化测试提供高频反馈,减少盲写代码。
  • /diagnosing-bugs:调试技能,将最佳调试实践封装为可重复的故障排查流程。
  • /improve-codebase-architecture:代码设计救火技能,帮助重建因快速迭代而恶化的模块结构。

技术亮点:
基于 skills.sh 标准与 Claude Code 原生插件机制,支持 Codex、Claude Code 等多代理架构;技能以独立 Markdown 文件发布,可编辑、可组合。


2. Lordog/dive-into-llms ⭐ 今日 +328#

语言/许可: Jupyter Notebook / 无
总 Stars: 45.0k
仓库: GitHub

项目定位:
面向 LLM 研究者与学生的系统性编程实践教程,覆盖从微调部署到安全对齐的完整技术栈。与华为昇腾合作推出国产化全流程课程。

核心功能:

  • 覆盖 11 个主题:微调与部署、提示学习与思维链、知识编辑、数学推理(迷你 R1 蒸馏)、模型水印、越狱攻击、多模态模型、GUI Agent、智能体安全、RLHF 安全对齐。
  • 每个主题包含课件(PDF)、实验手册(README)和可运行 Jupyter Notebook。
  • 与华为昇腾联合推出基于昇腾硬件的《大模型开发全流程》系列课程,覆盖初级到高级。

技术亮点:
国产化版本基于昇腾基础软硬件栈,提供从模型迁移到调优的全流程实战;实验脚本可直接在昇腾设备上运行。


3. OtterMind/Chat2DB ⭐ 今日 +82#

语言/许可: Java / 未声明
总 Stars: 26.3k
仓库: GitHub

项目定位:
面向开发者与 DBA 的 AI 驱动数据库客户端与 SQL 工作台,支持 30+ 数据库,集成自然语言转 SQL、SQL 解释与优化。

核心功能:

  • 多数据库支持:MySQL、PostgreSQL、Oracle、SQL Server、ClickHouse、MongoDB、Redis、Snowflake、BigQuery 等 30+ 种,通过插件扩展。
  • AI 助手:用户自带 AI 模型(Claude、OpenAI、Ollama 等),支持生成、解释、优化 SQL,以及自然语言对话式查询。
  • 完整 SQL 工作台:编辑器、自动补全、格式化、历史记录、执行计划分析。
  • 数据管理:元数据浏览、可视化数据编辑、ER 图、数据导入导出、看板与图表。

技术亮点:
桌面端基于 Java 构建跨平台 GUI,服务端支持 Docker 部署;存储密码与 API Key 使用 AES-256-GCM 加密;提供 CLI 版本并支持 MCP 协议集成。

🟧 Hacker News 热议#

Claude Opus 5#

1212 pts · 660 comments · anthropic.com

📌 内容总结

  • Anthropic 发布 Opus 5,定位为日常使用的高性价比模型:性能接近旗舰 Fable 5,但价格为其一半(5/5/25 per M tokens)。在 Frontier-Bench、ARC-AGI 3、OSWorld 等编码与知识工作基准上取得 SOTA,但在网络安全(OSS-Fuzz)上仍弱于 Mythos 5。
  • HN 关注点:
    • Opus 5 用更低的成本实现了接近 Fable 5 的能力,价格敏感用户直接受益。
    • 安全与对齐:Opus 5 被自动行为审计评为“最对齐模型”,但安全分类器限制了二进制漏洞扫描,而源码漏洞发现被允许——这与 Fable 5 的策略不一致。
    • 基准争议:OSWorld 2.0 分数与作者论文不一致(“完成率” vs “部分得分”),引发对基准可比性的质疑。

💬 讨论总结

  • 共识观点:Opus 5 相比 Opus 4.8 提升显著且定价不变,是日常编码和知识的可靠选择。ARC-AGI 3 得分 30% 被部分用户视为模型超越基准“油水”的能力证明。
  • 工程经验:多位早期用户反馈 Opus 5 在自我验证、根因分析、长序列任务中表现突出;主动检查 UI 跨尺寸对齐,修复社区 patch 遗漏的 bug。
  • 商业现实:模型发布节奏加快,旧模型快速贬值;模型路由服务(如 OpenRouter)兴起,因为它们能自动选择性价比最优的模型——这恰是厂商不愿强调的方面。
  • 反对 / 质疑
    • 基准表格中 Sol 领先的行被标灰而非红色,被指选择性呈现。
    • 安全限制不一致:Fable 5 屏蔽源码漏洞发现而 Opus 5 允许,但两者对二进制扫描的封锁标准不同,造成用户困惑。
    • Opus 5 与 Fable 5 差异模糊:既然 Opus 5 在多数基准上接近甚至反超,Fable 5 存在的意义是什么?回复指出 Fable 在规划、长上下文和“性格”上仍有区别。
  • 历史背景:有评论将本次发布与 OpenAI 的 GPT-5.6 Sol 类比,认为 token 效率是当前焦点,但 Opus 5 的训练投入可能早于该趋势。

🔗 原文 · HN 讨论页

Flux 3 X Mimic: The Next Generation of Video-Action Models#

308 pts · 48 comments · bfl.ai

📌 内容总结

  • Black Forest Labs 联合 mimic robotics 发布基于 Flux 3 的视频动作模型 FLUX-mimic。核心思路:视频预测迫使模型学习物理世界的接触、运动、因果关系,因此同一骨干可同时用于内容生成和机器人动作预测。
  • HN 关注点:
    • 通过 Self-Flow 方法统一生成与表示学习,解决传统生成模型特征空间难以解耦的问题,使动作解码器可以从冻结的 Flux 3 骨干中直接提取动作。
    • 在 Audi 工厂部署,成功处理软管、密封条等传统自动化难以应对的柔性零件操作,达到 101ms 反应延迟(RTX 5090 上 ~80ms)。

💬 讨论总结

  • 该帖尚未引发 HN 社区讨论(暂无有效评论摘要)。

🔗 原文 · HN 讨论页

Be skeptical of OpenAI’s rogue hacker agent story#

385 pts · 210 comments · theguardian.com

📌 内容总结

  • Guardian 评论文章,作者 John Thickstun 认为 OpenAI 关于“AI agent 自主入侵 HuggingFace”的故事是营销套路:渲染 AI 威力以吸引投资并推动有利于自身的监管环境,手法与 2019 年 GPT-2 “太危险不能发布”的公关活动如出一辙。
  • HN 关注点:
    • 作者指出,若攻击者和防御者都拥有强大 AI,网络安全可能变得更安全;但美国前沿模型的安全护栏反而限制了防御用途(如 HuggingFace 只能用中国开源模型 GLM 5.2 分析入侵)。
    • 文章质疑:美国 AI 产业走向“集中化、威权式”治理,而中国在推动开源——哪种风险更值得警惕?

💬 讨论总结

  • 该帖尚未引发 HN 社区讨论(暂无有效评论摘要)。

🔗 原文 · HN 讨论页

今日洞察#

Claude Opus 5 的定价策略透露了 Anthropic 的产品分层意图:将旗舰级能力下放到主流价格带。 Opus 5 在多数基准上匹配甚至超越 Fable 5,但 API 价格仅为后者一半(5/5/25 per M tokens)。这不是单纯的降价——Fable 系保留极致性能与安全能力(如二进制漏洞扫描),而 Opus 系承担日常高智能编码与知识工作的主力角色。这一调整的直接后果是:任何基于 Fable 5 价格构建的业务模型都需要重新评估成本结构;同时,模型路由服务的价值更加突出——HN 讨论中已有人指出 OpenRouter 等平台能自动选择性价比最优的模型,而这正是模型厂商不愿公开强调的。随着 Opus 5 和 Kimi K3(Code Arena 超越 Fable 5,成本仅 1/3)等产品出现,“性价比”正成为比“绝对性能”更关键的竞争维度。

黄仁勋在 X 的首条推文是一封联合数十家公司支持开源的公开信,标志着开源模型从社区偏好升级为产业共识。 当全球最大 AI 算力供应商、微软、Meta、Hugging Face 等共同呼吁“不要过早限制开源模型”时,开源已不再是技术选项,而是关乎产业生态与国家竞争力的战略议题。二阶影响包括:美国政策制定者将面临更强大的工业界压力;开源模型获得硬件层的优先优化(NVIDIA 的 ModelExpress 已展示对 DeepSeek-V4 Pro 的启动加速);闭源模型厂商的差异化将更依赖安全、可控等非价格维度。同日美团开源 LongCat-2.0 的国产卡推理栈,也印证了开源生态正在获得“自主可控”层面的产业级支撑。