Yeekal Logo Yeekal
2,461 字
晚报 | EVENING 2026-07-21

🌙 AI Daily 晚报 | 2026-07-21

上一期 · 2026-07-20 已是最新一期

title: “NVIDIA开源Cosmos 3 Edge,Fable 5参与攻克雅可比猜想” lead: “NVIDIA发布4B参数世界模型Cosmos 3 Edge,完全开源可运行在设备端;Anthropic数学家使用Fable 5发现雅可比猜想反例,87年未解问题被攻克;Cursor团队用Agent群复现SQLite,成本差异达15倍。” highlights:

  • “NVIDIA发布Cosmos 3 Edge,4B参数开源世界模型可运行在Jetson等边缘设备”
  • “Anthropic研究员用Fable 5发现雅可比猜想反例,87年数学猜想被推翻”
  • “Cursor用多Agent团队从手册重建SQLite,模型组合成本差异达15倍”

1️⃣ NVIDIA发布Cosmos 3 Edge:可运行在设备端的开源世界模型#

  • 核心发布:NVIDIA AI今日正式发布Cosmos 3 Edge,一个4B参数的开源世界模型,专为在DGX Spark、NVIDIA Jetson等设备端运行而优化。模型包含一个2B的Nemotron-based推理器,可实现物理世界的理解、预测与交互。
  • 性能亮点:在VANTAGE-Bench视觉分析基准上,Cosmos 3 Edge在同类开源模型中排名第一。模型权重、后训练配方和代码已在Hugging Face上完全开源。
  • 应用场景:NVIDIA称该模型可帮助机器人学习和行动、让自动驾驶车辆理解道路场景并预测意图、以及让视觉AI Agent在智能基础设施中分析实时视频。
  • 行业意义:这是目前公开最强的可在设备端运行的开放世界模型。4B参数使其在资源受限的边缘设备上也能实现环境理解,直接面向机器人和自动驾驶等物理AI场景。 🔗 NVIDIA AI推文 | Hugging Face博客

2️⃣ [持续跟踪] Meta拟向Anthropic出租算力:最高100亿美元合同#

  • 前情提要:此前Anthropic因算力需求快速增长,已与SpaceXAI签署450亿美元长期算力协议。Meta被曝因AI模型进展缓慢,大量算力处于闲置状态。
  • 最新突破:据纽约时报报道,Meta正与Anthropic洽谈将自有AI数据中心算力出租,份为期两年的合作协议规模最高可达100亿美元。Anthropic在6月提出合作方案,Meta仍在评估中。至2026年,Meta数据中心可用容量将达5GW。
  • 行业意义:大型科技公司向AI实验室出租算力正在成为新常态。Meta手握大量余量算力却选择出租而非内化于自身AI产品,这被部分分析人士解读为对其AI产品化信心不足的信号。 🔗 小互推文

3️⃣ Cursor用Agent Swarm复现SQLite:成本差异达15倍#

  • 核心发布:Cursor官方今日宣布,他们使用了一个多Agent团队,仅凭835页的SQLite文档(无源码、无官方测试),在Rust中从头复现了一个SQLite副本,该副本通过了100%的 withheld测试套件。更关键的是,根据使用的模型组合不同,总成本差异高达15倍。
  • 模型经济学:Cursor团队详细拆解了成本构成:全程使用Claude Fable 5成本约20,057;使用Opus4.8规划+Composer2.5执行则仅需20,057;使用Opus 4.8规划+Composer 2.5执行则仅需1,339。核心洞察是——大任务中真正需要frontier模型的时刻很少(根拆解、设计决策),一旦歧义被压成明确指令,便宜模型就能高效执行。
  • 架构设计:团队采用“树状” swarm架构,强模型做Planner负责分解和委派,弱模型做Worker执行窄任务。关键扩展性来源是上下文效率而非单纯并行——让每个Agent只关注自己该关注的上下文。
  • 行业意义:这一实验为生产级Agent部署提供了成本优化的实证数据。它展示了模型路由和分层架构的潜力,打破了“更强模型必然更优”的直觉,确立“成本与性能分离管理”的工程范式。 🔗 Cursor推文 | Agent Swarm博客

4️⃣ 美团LongCat-2.0全面开源:万亿参数+国产卡推理+三大基准#

  • 核心发布:美团技术团队今日正式宣布万亿参数大模型LongCat-2.0全面开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,专为Agentic Coding任务设计。同步开源针对国产芯片极致优化的推理代码。
  • 开源生态:开源内容包括:BF16/FP8/INT8等多精度模型权重、GPU推理代码(基于SGLang)、NPU推理代码(基于SGLang-FluentLLM),以及针对国产芯片的Super Kernel、Weight Prefetch等优化策略。同时开源了长期动态用户建模基准VitaBench 2.0和交互式世界模型评测基准WBench。
  • 性能表现:在SWE-bench Pro达59.5(领先Gemini 3.1 Pro和GPT-5.5),在Terminal-Bench 2.1达70.8。已在OpenRouter全球大模型调用量中跻身前三。
  • 行业意义:这是业界首个完整开源万亿参数模型及国产卡推理栈的项目。它验证了国产算力承载前沿模型的能力,为行业提供了一条可复现的技术路径。 🔗 美团技术博客 | HuggingFace

5️⃣ Ramp推出模型路由功能:一个API入口,按步骤切换最佳模型#

  • 核心发布:企业财务管理平台Ramp今日推出Ramp Router,一个OpenAI兼容的模型路由端点,可自动为每一条请求选择最合适的模型。该功能源自Ramp内部运行了3年的LLM路由器,支持GPT、Claude、Gemini、Grok、Qwen、DeepSeek、Kimi、GLM等所有主流模型。
  • 核心价值:Ramp Router允许开发者在不同Agent工作流步骤中使用不同模型,从而在不牺牲性能的前提下大幅降低成本。其API入口与OpenAI标准兼容,用户无需重写应用即可接入。
  • 行业意义:随着模型供给侧的爆发式增长,模型路由正在成为Agent基础设施中的核心组件。Ramp的切入表明,这一趋势已从技术验证转向商业化产品。 🔗 veeral推文 | elvis评论

6️⃣ [持续跟踪] 全球热议:Claude Fable 5参与的雅可比猜想反例发布#

  • 前情提要:Anthropic的研究员levent此前曾分享Fable 5参与攻克复杂数学问题的工作。今日该话题在全球科技社区引爆。
  • 最新突破:Anthropic的研究员levent在X上发文,使用Claude Fable 5帮助发现了一个雅可比猜想的三维反例。该反例已在Wolfram Alpha上验证。雅可比猜想由凯勒于1939年提出,是代数几何和多项式环理论中的著名开放问题,被列入斯梅尔的21世纪问题之一。87年来无人能证明其真伪,甚至曾是数学家张益唐博士论文试图解决的问题。
  • 社区反响:该推文获得超2000万次浏览。OpenAI团队随后表示其内部Codex版本也独立发现了相同的反例。数学家和AI研究者普遍承认这是AI在纯数学前沿的里程碑式突破。Grok也确认这是一个有效的反例。
  • 行业意义:这一事件标志着AI在纯数学领域从“辅助工具”向“合作研究者”的角色转变。它表明前沿模型已经能够处理极具深度的抽象数学问题,而非仅仅是编程或模式识别。 🔗 op7418推文 | levent原始推文

7️⃣ Gemini Batch API重大升级:p95延迟降低80%,成功率超99.998%#

  • 核心发布:谷歌今日宣布Gemini Batch API完成重大基础设施升级,核心指标显著提升:p95延迟降低80%、p99延迟降低68%、成功率超过99.998%(8个9)、批次过期减少98%。同时新增了对Partial Batches的支持。
  • 使用建议:谷歌开发者关系负责人Logan Kilpatrick提醒开发者,如果不使用Batch API(以节省成本),应该尽快查看其文档。Batch API适合对延迟要求不苛刻的批量任务,成本远低于实时API。
  • 行业意义:Batch API的可用性和性能大幅提升,为大规模后训练、数据标注和离线推理场景提供了更可靠的云基础设施,降低了规模化部署的Token成本。 🔗 Logan Kilpatrick推文

8️⃣ 通义发布Qwen-Audio-3.0-TTS:16种语言20种方言,音色不走样#

  • 核心发布:通义千问今日发布Qwen-Audio-3.0-TTS语音生成模型。核心亮点是只需一段参考音频,就能跨16种语言和20种方言在保持音色一致性的前提下进行语音生成。首包延迟控制在了300毫秒级。
  • 性能数据:在CV3-Eval评测中,其说话人相似度在16个语种上全部排名第一,Plus平均得分82.75分(百分制,越接近100越像本人)。这使其在跨语言声音克隆赛道中达到了业界领先水平。
  • 行业意义:高质量的跨语言声音克隆能力将极大降低内容出海、多语言视频制作和语音Agent的门槛。它让一个角色的声音可以无缝在不同语言中保持一致性。 🔗 小互推文