Yeekal Logo Yeekal
2,880 字
早报 | MORNING 2026-07-27

GPT-5.6 Sol 解决6个开放问题,Stripe 100亿美元收购OpenRouter

今日要点
  • GPT-5.6 Sol 5天解决6个Erdős问题,提示词和证明全部公开
  • Stripe拟100亿美元收购OpenRouter,AI API网关估值翻8倍
  • Sam Altman展示ChatGPT自动规划旅行并制作网站,全程无需干预
上一期 · 2026-07-26 已是最新一期
华裔研究者Shouqiao Wang使用GPT-5.6 Sol模型在5天内解决6个开放Erdős问题,公开GitHub仓库包含证明和提示词。支付巨头Stripe被曝以最高100亿美元收购模型API聚合平台OpenRouter,收购价为最新估值的近8倍。Sam Altman演示ChatGPT从手机指令自动规划旅行、制作全栈网站并预订,标志个人AI助手进入全自主工作阶段。

1️⃣ [持续跟踪] ChatGPT/Codex自主工作能力升级:从规划旅行到数学研究#

  • 前情提要:近期ChatGPT和Codex不断展示更强的Agent能力。
  • 最新突破:Sam Altman今日在X上演示,从手机发送一条指令:“利用我的聊天历史为8个朋友规划长周末旅行,计划三个选项,制作一个全栈网站让大家协调和决定,然后做预订,并草拟邀请邮件。”ChatGPT自动完成所有步骤。他认为“work”一词不足以描述其能力。Greg Brockman转推称“ChatGPT正成为你的个人AGI”。此外,OpenAI DevEx工程师Jason Liu在访谈中展示Codex的日常使用:设置Slack/邮件酋长、将过去会话转化为技能、让Codex定期检查邮件和Linear并生成优先级概览。这些演示标志着ChatGPT/Codex从单次问答走向持续、多步骤、自主的Agent工作。
  • 行业意义:从复杂旅行规划到日常办公自动化,AI Agent已具备“一键式”解决长链路任务的能力,用户只需描述目标。这预示着个人AI助手从“聊天”到“替人工作”的范式转变。 🔗 Sam Altman推文 | Greg Brockman推文 | Peter Yang视频

2️⃣ GPT-5.6 Sol 解决6个开放数学问题,数学研究迎来AI辅助新时代#

  • 核心亮点:华裔研究者 Shouqiao Wang 使用 OpenAI GPT-5.6 Sol 模型,在5天内解决了6个开放的 Erdős 问题。他公开了所有材料:GitHub 仓库包含每个问题的证明 PDF、LaTeX 源文件、提示词和部分计算实验 Python 脚本,其中两个问题已有 Lean 形式化证明。
  • 方法论:Wang 具有数学背景,但使用的 Codex 工作流不要求深数学知识。这展示了前沿模型在数学研究中的实用价值。
  • 行业意义:这是继两周前 AI 推翻 Erdős 单位距离猜想后的又一重大数学 AI 突破。AI 正从“辅助验证”走向“问题提出与解决”的前沿,可能重塑数学研究范式。 🔗 Wang的GitHub仓库 | FinanaceYF5介绍

3️⃣ Stripe 被曝以最高100亿美元收购 OpenRouter#

  • 核心亮点:据 Andrew Curran 报道,支付巨头 Stripe 正在洽谈收购模型聚合平台 OpenRouter,交易价格可能高达 100 亿美元。OpenRouter 最近一轮估值为 13 亿美元,收购价可能是其估值的近 8 倍。
  • 行业意义:OpenRouter 是 AI 模型 API 网关的关键基础设施,统一接入数十个模型。Stripe 若收购,将获得 AI+支付的双重战略支点,也反映了 AI 基础设施的整合趋势。此交易若完成,将是 AI 领域最大并购之一。 🔗 Andrew Curran推文 | FinanaceYF5概述

4️⃣ NVIDIA 研究证明 AdamW 存在规模天花板,SOAP/Muon 大批量训练更优#

  • 核心发布:NVIDIA 团队发表新论文,声称 AdamW 在大批量训练中存在“规模天花板”。在批大小高达 1 亿 token 的下一词预测中,SOAP 和 Muon 优化器保持稳定性和质量,而 AdamW 性能下降。团队通过逐层分布式优化器与 Megatron-LM 兼容,在不近似优化器数学的前提下平衡通信和内存。
  • 行业意义:AdamW 是深度学习最常用的优化器。如果其在大规模训练中确实存在天花板,这意味着业界需要迁移到更高阶的优化器。NVIDIA 的方案提供了系统级的可行性,可能加速训练范式转换。 🔗 论文链接 | elvis概述

5️⃣ GitHub Copilot App 全面通用发布#

  • 核心亮点:GitHub 官方宣布 GitHub Copilot 桌面应用在 macOS、Windows 和 Linux 上正式 GA。推荐用户将 Copilot 应用固定在 dock 中,以随时使用 AI 编码辅助。
  • 行业意义:Copilot 从 IDE 插件扩展到独立桌面应用,支持全平台,标志着 AI 编码助手进入“随时可用”的新阶段。开发者无需打开编辑器即可与 Copilot 交互。 🔗 GitHub官方推文

6️⃣ [持续跟踪] Claude Opus 5 实际体验与基准失效:评测指标的信任危机#

  • 前情提要:Anthropic 于 7 月 25 日发布 Claude Opus 5,官方声称智能接近 Fable 5 但定价减半。昨日我们报道了初步评测分歧。
  • 最新突破:今日多位专家深度分析。Kun Chen 指出 Opus 5 几乎每项指标超越 Fable 5,但实际使用体验远不如 Fable,认为现有基准几乎完全失效。他还观察到 Anthropic 改变了训练方式:先训 Mythos 再蒸馏为 Sonnet 和 Opus,可能影响模型质量。orange.ai 补充指出“Claude 系列用起来的味道不对”,而 Grok 和 Kimi 体验更好。RLVR 只重视可验证结果,人类偏好被弱化,对齐可能失败。
  • 行业意义:基准失效和训练方式变革揭示了行业深层问题:当模型能力超越现有测试集,我们需要更鲁棒的评测方法。同时,RLVR 驱动的训练可能牺牲人类友好的交互体验,这是对齐领域的警钟。 🔗 Kun Chen推文 | orange.ai推文

7️⃣ Midjourney 收购占星 AI 公司 Co-Star#

  • 核心亮点:Midjourney 官方宣布收购个性化和占星 AI 平台 Co-Star。Co-Star CEO Banu Guler 成为 Midjourney 首席设计官,负责组建跨职能设计、产品和前端团队。Co-Star 应用将继续独立运营。
  • 行业意义:Midjourney 从图像生成扩展到个性化 AI 和社交体验。收购占星 AI 公司看似跨界,但 Co-Star 在个性化推荐和用户情感连接上有独特积累,Midjourney 可能利用其技术增强用户黏性和创意工具的情感智能化。 🔗 Midjourney官方推文

8️⃣ LLM Token 代理转售市场调查:滥用免费试用和盗刷信用卡#

  • 核心调查:Matt Lenhard 发表调查文章,揭示围绕 LLM token 转售的黑市。转售商通过滥用免费试用、利用未受保护的内部代理、甚至盗刷信用卡来获得低价 API 额度,然后以折扣价出售。在中国尤甚,使用开源代理软件(如 one-api、new-api)搭建代理池。买家寻求便宜 token、绕过地理限制和模型蒸馏。
  • 行业意义:这个市场暴露了 LLM API 计费和安全的漏洞。LLM 供应商需要提供更严格的支出上限和防滥用措施。对于开发者,将 AI 应用公开暴露面临更大的恶意消耗风险。 🔗 Simon Willison转述 | 原始调查

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
pingdotgg/t3codeAI Agent15.0k
pbakaus/impeccableAI Agent50.6k

1. pingdotgg/t3code ⭐ 今日 +149#

语言/许可: TypeScript / MIT
总 Stars: 15,036
仓库: GitHub

项目定位:
面向 AI 编码代理的轻量级 Web GUI,统一管理 Codex、Claude、Cursor、OpenCode 等多个代理的本地执行会话。

核心功能:

  • 支持多个主流 AI 编码代理作为后端引擎,通过 CLI 或桌面应用启动统一交互界面
  • 提供远程访问能力,允许在开发机上运行代理,从其他设备连接会话
  • 内置架构文档和提供者指南,便于自托管部署和扩展
  • npx t3@latest 零安装运行,降低试用门槛

技术亮点:
基于 Vite+ 构建(VitePlus),使用 vp 管理依赖,支持多平台桌面应用分发(winget、Homebrew、AUR)。


2. pbakaus/impeccable ⭐ 今日 +413#

语言/许可: JavaScript / Apache-2.0
总 Stars: 50,638
仓库: GitHub

项目定位:
面向 AI 编码代理(如 Claude Code、Cursor、Gemini CLI 等)的设计技能集,通过 23 条命令 + 60 条确定性检测规则,约束 AI 生成的前端设计质量。

核心功能:

  • /impeccable init 一键初始化项目设计上下文,生成 PRODUCT.mdDESIGN.md,为后续命令提供品牌、颜色、字体等规范
  • 23 条命令覆盖设计全流程:craft(从形状到代码迭代)、audit(技术质量检查)、critique(UX 评审)、polish(终版对齐)等
  • 60 条确定性检测规则(无需 LLM 和 API Key),与 LLM 审查互补,自动检查 a11y、性能、响应式等缺陷
  • 支持 12+ 个主流 AI 编码代理(Claude Code、Cursor、Codex、Grok Build、GitHub Copilot 等),通过 npx impeccable install 一键部署到本地 harness 目录

技术亮点:
设计规则以确定性代码实现,不依赖模型推理,可离线运行,保证了输出一致性;多代理 harness 结构统一,插件化部署兼容不同工具的技能目录约定。

今日洞察#

数学研究AI辅助的门槛正在消失。 Shouqiao Wang使用GPT-5.6 Sol解决6个开放Erdős问题,他在说明中强调自己虽有数学背景,但工作流不依赖深数学知识——Codex自动处理证明构造,他只需提供方向性提示。此前两周AI刚推翻Erdős单位距离猜想,两件事组合释放的信号是:前沿模型使非专家也能产出可验证的数学结果。二阶影响:数学研究将不再完全依赖顶级数学家直觉,有系统能力的工程师可能比数学家更高效地探索猜想空间,学术分工面临重构。

模型API基础设施正在经历双重挤压:一边是Stripe以100亿美元收购OpenRouter,一边是LLM token转售黑市通过盗刷信用卡获利。 OpenRouter作为统一API网关,一旦被支付巨头控制,模型分销渠道将高度集中,小型模型提供商可能丧失独立触达客户的能力。同时黑市调查揭示现有API计费防滥用机制脆弱——开发者公开暴露AI应用时面临恶意消耗风险,这将倒逼供应商快速推出更严格支出上限和身份验证手段。两条线索指向同一个结论:API经济的中间层正在成为战略节点,但安全边界远未成熟。

Claude Opus 5的基准失效与NVIDIA的AdamW天花板论文,指向AI工程共识的同步松动。 Kun Chen指出Opus 5几乎每项基准超越Fable 5但实际体验糟糕,Anthropic先训Mythos再蒸馏的做法可能解释了两者脱节。NVIDIA团队则证明AdamW在大批量训练中存在规模天花板,SOAP/Muon优化器表现更优。两件事看似无关,但都说明当前依赖的工程判断——无论是评测指标还是默认优化器——正在失效。当基准不再反映真实能力、默认优化器遇到尺度限制,行业需要重新建立从训练到评估的基础设施。