Yeekal Logo Yeekal
5,551 字
早报 | MORNING 2026-07-24

FLUX 3 发布,OpenAI 上线 Health,Cognition 收购 Poke

今日要点
  • Black Forest Labs FLUX 3 整合多模态生成与动作预测
  • OpenAI ChatGPT Health 接入个人健康数据
  • Cognition 收购 Poke,短信 Agent 与 Devin 合并
上一期 · 2026-07-23 已是最新一期
Black Forest Labs 发布 FLUX 3,一个统一架构的多模态模型,支持图像、视频、音频生成及动作预测,开源模型将在几周内发布。OpenAI 正式向美国用户推出 ChatGPT Health,允许连接 Apple Health 及医疗记录系统。Cognition 宣布收购 The Interaction Company,其 AI 代理 Poke 将与 Devin 合并,打造始终在线的云 Agent。

title: “Black Forest Labs 发布 FLUX 3,OpenAI 上线 Health, Cognition 收购 Poke” lead: “Black Forest Labs 发布多模态模型 FLUX 3,支持图像/视频/音频/动作预测;OpenAI 向美国用户推出 Health 功能,可连接苹果健康与医疗记录;Cognition 宣布收购 The Interaction Company,其 AI 代理 Poke 将与 Devin 合并;Andrew Ng 开源 OpenWorker,微软发布 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash。” highlights:

  • “Black Forest Labs 发布 FLUX 3 多模态模型,支持 20 秒视频生成”
  • “OpenAI 上线 ChatGPT Health,连接 Apple Health 与医疗记录”
  • “Cognition 收购 Poke 制造商,Devin 与短信 Agent 合并”

1️⃣ Black Forest Labs 发布 FLUX 3:统一多模态模型,支持图像/视频/音频/动作预测#

  • 核心发布:Black Forest Labs 今日正式发布 FLUX 3,一个统一架构的多模态基础模型,可同时处理图像、视频、音频和动作预测(用于机器人)。视频生成支持单次 20 秒多镜头输出,音频可同步生成。
  • 功能特性:支持文生视频、图生视频、视频参考生成、关键帧控制、智能剪辑、视频与音频延长、文字动画等 8 大功能。模型在仅提供简单文字 prompt 时便能自主决定镜头切换与角度,生成细节逼真的多片段视频。
  • 开源与获取:FLUX 3 Dev 模型将开源(未来几周内),目前开放早期访问申请。API 将在未来几周开放。开源模型权重使开发者可在本地部署。
  • 行业意义:FLUX 3 是首个将视频生成、音频生成和动作预测整合在同一架构中的开源级模型。其统一架构和为机器人等物理世界应用设计的扩展能力,标志着生成式 AI 从“内容生成”向“世界理解与交互”的跨越。 🔗 Black Forest Labs 官方推文 | FLUX 3 申请链接 | 归藏中文详解

2️⃣ OpenAI 向美国用户推出 ChatGPT Health:连接 Apple Health 与医疗记录#

  • 核心发布:OpenAI 今日宣布 ChatGPT Health 功能开始向美国用户逐步推送。用户可在侧边栏“Health”中安全连接 Apple Health 及受支持的医疗记录系统,查看时间线、分析趋势并获得个性化健康洞察。
  • 隐私保护:OpenAI 明确表示,连接的医疗记录和 Apple Health 数据不会用于训练基础模型或定向广告。用户可完全控制数据的连接与删除。
  • 功能场景:ChatGPT 可在对话中利用已连接的上下文——例如比较新结果与既往检测、总结历次就诊变化、探索睡眠与活动的关系。每周已有超 3 亿人向 ChatGPT 提出健康相关问题。
  • 行业意义:这标志着对话式 AI 正式进入个人健康数据管理这一高度敏感领域。OpenAI 通过严格的隐私承诺和与医疗记录的深度集成,将 ChatGPT 从通用助手升级为个人健康信息的中枢平台,可能重塑患者与医疗数据交互的方式。 🔗 OpenAI 官方推文 | ChatGPT App 推文 | 官方博客

3️⃣ Cognition 收购 The Interaction Company,短信 Agent Poke 将合并至 Devin#

  • 核心发布:Cognition 今日宣布收购 The Interaction Company,后者是短信消息式 AI 代理 Poke 的创造者。交易细节未公开,Cognition CEO Scott Wu 表示“两个团队一直在下相同的赌注:始终在线的云 Agent”。
  • 团队融合:Poke 基于文本消息的交互模式将与编程 Agent Devin 结合。Scott Wu 透露,该收购已筹备两年,Poke 创始人 Marvin von Hagen 曾参与 Devin 最初的发布视频拍摄。
  • 产品整合:Devin Outposts 此前已将 Devin 部署能力扩展到用户自有机器,本次收购将进一步丰富 Devin 的交互界面和能力边界。
  • 行业意义:Cognition 通过收购将“编码 Agent”与“通用短信 Agent”合并在同一产品线,朝着“统一始终在线 Agent”的战略目标迈出关键一步。这预示着 AI Agent 公司将不再局限于单一场景,而是构建跨通信方式的综合能力。 🔗 Cognition 推文 | Scott Wu 推文 | 收购博客

4️⃣ Andrew Ng 宣布开源 OpenWorker:自主完成实际工作,隐私优先#

  • 核心发布:AI 领袖 Andrew Ng 今日宣布开源 OpenWorker,一个可自主完成交付型工作的 Agent(如起草报告、发送 Slack 消息、更新日历项)。项目已在 GitHub 开源,可运行于 Mac(Windows 支持即将到来)。
  • 关键特性:OpenWorker 不绑定任何单一模型,用户可自选 API key 接入 GPT-5.6 Sol、Claude Fable、Gemini 3.6、开源模型(Kimi、GLM、DeepSeek、Inkling)或通过 Ollama 本地运行。数据仅在用户本地、LLM 提供商及所选集成间流通。
  • 产品理念:OpenWorker 被定位为“AI 同事”,专注于交付成果而非单纯聊天。它会在执行重要操作前主动确认,确保用户对结果有控制权。
  • 行业意义:Andrew Ng 作为 AI 教育界最有影响力的人物之一,其亲自参与开源的 Agent 项目将进一步推动“AI 作为工作协作者”的范式。模型无关和本地优先的设计,为隐私敏感的 Agent 部署提供了可复现的参考架构。 🔗 Andrew Ng 推文 | GitHub 仓库

5️⃣ 微软发布 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash:专业级图像与语音模型#

  • 核心发布:微软 AI 负责人 Mustafa Suleyman 今日宣布推出两款新模型。MAI-Image-2.5-Pro 是微软迄今最高保真度的专业级图像模型,支持超高质量输出、精细编辑和精准文字渲染。MAI-Voice-2-Flash 相比前代速度快 2 倍,成本低 32%,已在 Dynamics 365 Contact Center 中应用,最高可降低 GPU 成本 89%。
  • 产品集成:微软已将这些模型嵌入自家产品。在 PowerPoint 中,MAI 模型相较 GPT-Image-2 成本降低 84%;在 OneDrive 中,保存率提升 26%,延迟降低约 25%;在 Bing 中作为默认图像模型。Dragon Copilot 转录模型覆盖 58 种语言,错误率减半。
  • 行业意义:微软通过自研 MAI 模型家族在办公套件中实现“模型即产品”的垂直整合,大幅降低外部 API 依赖。MAI-Image-2.5-Pro 的高质量定位直接对标 Adobe 等专业创意工具,标志着微软在 AI 原生创作基础设施上开始独立布局。 🔗 Mustafa Suleyman 推文 | MAI-Voice-2-Flash 推文 | 微软 AI 新闻

6️⃣ [持续跟踪] Grok 4.5 现已全平台上线#

  • 前情提要:昨日 Elon Musk 预告 Grok 4.5 已取得进展,OpenRouter 上用量开始攀升。
  • 最新突破:Elon Musk 今日正式宣布,Grok 4.5 已在 grok.com、X 平台、iOS 和 Android 应用全量上线。Grok 官方称其为“至今最强大的模型”。OpenRouter 数据同步显示 Grok 4.5 已进入封闭模型使用量前十。
  • 行业意义:Grok 4.5 全平台上线补全了 xAI 在消费者端的最后拼图。xAI 以极低的任务成本和极快速度在边缘追赶,其“大参数+高效率”路线在此次发布中得到验证,进一步加剧了千亿美元级模型市场的竞争烈度。 🔗 Elon Musk 推文 | Grok 官方推文

7️⃣ [持续跟踪] ChatGPT Voice 登陆桌面版:支持语音控制 Codex 多 Agent#

  • 前情提要:昨日 Codex 实时语音模式被泄露预告,今日正式发布。
  • 最新突破:OpenAI 官方宣布,ChatGPT Voice 现已登陆 macOS 与 Windows 桌面端。该功能基于 GPT-Live 模型,支持用户用语音控制计算机、指挥 ChatGPT Work 或 Codex 中的多个 Agent 协同工作。桌面端语音可同时进行说话、收听和协调任务。Plus/Pro/Business/Edu/Enterprise 用户均可使用。
  • 附加能力:通过 iOS 配对远程访问,用户可在手机端语音控制 Codex。
  • 行业意义:桌面端 + 语音 + 多 Agent 控制,将 ChatGPT 从“对话机器人”升级为“语音指挥中心”。这是 OpenAI 对移动端和办公场景的一次关键延伸,也直接回应了 Claude Voice 多语言更新的竞争。 🔗 OpenAI 推文 | Greg Brockman 推文 | OpenAI Devs 推文

⭐ GitHub 趋势#

📊 类别速览

项目类别Stars
block/buzzAI Agent6.8k
citrolabs/ego-liteAI Agent (浏览器)1.6k
alibaba/open-code-reviewAI 开发者工具11.5k

1. block/buzz ⭐ 今日 +2162#

语言/许可: Rust / Apache-2.0
总 Stars: 6.8k
仓库: GitHub

项目定位:
面向 AI Agent 与人类团队的协同工作空间,基于 Nostr 协议的事件日志架构,让 Agent 与人类共享同一身份模型、同一审计线索。

核心功能:

  • Agent 作为频道成员,具备独立密钥和频道成员身份,可以像人类一样参与画布、工作流、语音房间
  • 内置 Git 事件支持(NIP-34),将分支、补丁、CI 状态、合并决策聚合为单一频道记录
  • YAML 定义的工作流引擎,支持消息/反应/调度/Webhook 触发器
  • 线级媒体评论(视频帧锚定注释)

技术亮点:
基于 Rust 实现 relay 层,所有交互通过 WebSocket 传输签名事件,保证身份可审计且无需中心化权限管理。


2. citrolabs/ego-lite ⭐ 今日 +247#

语言/许可: JavaScript / MIT
总 Stars: 1.6k
仓库: GitHub

项目定位:
专为人类和 AI Agent 并行工作设计的专用浏览器,每个 Agent 拥有独立隔离的 Space,通过 JavaScript 函数驱动而非 CLI 循环,减少 token 消耗并提升复杂任务完成速度。

核心功能:

  • Agent 以 JS 函数方式调用浏览器能力(snapshot、fill、click、navigate),单次调用完成多步操作,比 CLI 模式快 2.5×
  • 每个 Agent 拥有独立 Space,多个 Agent 可并行运行(如同时抓取 10 个竞品页面),不抢占用户标签页
  • 内置最强页面 Snapshot(内核级 iframe 处理),为 LLM 提供高质量页面视图
  • 支持服务积累(Experience Accumulation,即将上线),复用历史成功操作以加速后续类似任务

技术亮点:
将浏览器能力暴露为 ego-browser 技能(JSON in/out),兼容 Claude Code、Codex、Cursor 等任意 agent CLI;页面 Snapshot 基于内核级定制,可靠处理深层嵌套 iframe。


3. alibaba/open-code-review ⭐ 今日 +180#

语言/许可: Go / Apache-2.0
总 Stars: 11.5k
仓库: GitHub

项目定位:
经阿里大规模验证的 AI 代码审查 CLI 工具,采用“确定性工程 + LLM Agent”混合架构,在保证行级精度的前提下大幅压缩 token 消耗(约为通用 Agent 的 1/9)。

核心功能:

  • 基于 Git diff 进行逐文件审查,Agent 可读取完整文件、跨文件搜索以输出深层建议
  • ocr scan 模式支持全文件审计,适用于无 diff 的新代码库或目录
  • 内置细粒度规则匹配引擎(覆盖 NPE、线程安全、XSS、SQL 注入),比纯语言驱动更稳定
  • 支持 Delegation 模式:代理自身处理文件选择与规则解析,无需配置 LLM

技术亮点:
确定性阶段负责“文件选择/分组/规则匹配”,Agent 阶段负责动态决策与上下文检索;在 200 个真实 PR 基准上,Precision & F1 显著高于通用 Agent(如 Claude Code),而 token 消耗仅为 1/9。

🟧 Hacker News 热议#

Show HN: Echo – Fable-level results at 1/3 the cost using open-weight models#

185 pts · 90 comments · HN 讨论页

📌 内容总结

  • 背景:作者试验将多个 open-weight 模型(GLM-5.2、Kimi K2.7 等)组合成一个路由系统,而非依赖单一模型。核心想法是:若能预先知道每个问题该调用哪个模型、如何组合输出,理论上可以大幅提升性能——但该信息不可提前获得。Echo 尝试通过动态分配计算量和模型参与来逼近这个理想。
  • HN 关注点:
    • 路由策略的可行性:如何在没有先验信息的情况下决定模型分配?Echo 的内部信号未公开。
    • 成本节省的真实性:“1/3 成本”依赖于任务分布,且与 Anthropic 给大客户提供的批量折扣(200/mo获得约200/mo 获得约 2500 的 Fable 额度)对比并不突出。
    • 与 OpenRouter Fusion、Sakana Fugu、传统 ensemble 方法的异同。

💬 讨论总结

  • 共识观点:模型互补性确实存在,组合多个弱模型可能达到接近强模型的效果,这在 ML 中并非新事(ensemble 方法)。路由思路有潜力,但具体实现和基准透明性存疑。
  • 工程经验:MoE(Mixture of Experts)在 token 级别路由,而 Echo 在 prompt/任务级别路由,两者不同。缓存问题:不同模型间切换会破坏 prompt cache,可能抵消部分成本节省。
  • 商业现实:Anthropic 给大客户提供了高度补贴的包月计划,使得 Echo 的 cost advantage 对这类客户吸引力有限。但对于无法获得补贴的企业用户(多数 enterprise 用户),成本差异有意义。
  • 风险/限制:
    • 路由决策的质量难以评估,尤其是 coding/agentic 任务中很难定义“正确输出”。
    • Echo 会因错误分配而失败,作者也表示正在研究这些失败案例。
    • 没有公开的第三方基准,目前仅依赖作者的自定义 eval mix。
  • 反对意见:
    • 有人质疑这是“scam”,认为 Fable 类模型本身成本就不高,声称 1/3 有误导。
    • 隐私政策允许用数据训练,虽然作者已承诺修复,但早期用户有顾虑。
    • 有人指出需要注册、无免费试用的痛点,相比之下 Perplexity 等产品更友好。
    • 与 OpenRouter Fusion 区别被反复追问:Fusion 是等所有模型返回再综合,Echo 是路由到单个模型,延迟更低但容错性可能更差。

🔗 原文 · HN 讨论页

Show HN: Palmier Pro – Open-source macOS video editor built for AI#

109 pts · 17 comments · site

📌 内容总结

  • 作者想做什么:构建一个原生 macOS 视频编辑器,深度集成 AI(通过 MCP server 让 Claude 等 agent 操控编辑功能),开源并且免费使用。
  • 解决的问题:传统视频编辑软件对非专业用户门槛高,AI 可以简化流程(如自动调色、基于文字指令修改)。
  • 技术实现:Swift + Metal 原生应用,使用 Core Image 自定义 compositor 保证预览和导出一致,支持 .cube LUT、颜色轮、曲线、多种硬件加速效果(Metal kernels)。项目在 GitHub 上已获得 11k+ stars。
  • 产品设计:同时提供传统 GUI 和 agent 接口(MCP),用户可以通过 Claude Desktop 直接调用编辑命令。
  • 用户反馈焦点:目前评论主要为正面支持,用户期待试用,尤其对自动处理大量素材(如运动相机视频)感兴趣。

💬 讨论总结

  • 共识观点:原生应用(非 Electron)受到肯定;AI 辅助编辑是明显的需求;项目质量从 commit history 和文档看很扎实。
  • 工程经验:使用 Swift 意味着仅限 macOS,跨平台不是当前目标;作者提到了与同类项目(FableCut)的区别:FableCut 需要 Node+FFmpeg 本地服务 + 浏览器,Palmier Pro 是原生应用,体验更集成。
  • 商业现实:当前定价策略采用订阅制,但有用户建议改为 credits 模式,因为视频编辑需求不是每月都有。作者表示还在探索中。
  • 风险/限制:目前不支持 360 视频(如 Insta360),仅支持 .mov/.mp4;社区中暂时没有重大反对意见。

🔗 原文 · HN 讨论页

Launch HN: Screenpipe (YC S26) – Record how you work and turn that into agents#

51 pts · 49 comments · HN 讨论页

📌 内容总结

  • 背景:作者 Louis 长期实践“第二大脑”(自 2020 年起记录所有工作痕迹),先后构建了 Obsidian AI 插件、Embedbase 等。核心发现:要让 AI 真正有用,必须提供 rich context——不仅仅是当前 prompt,而是用户屏幕上发生的一切。
  • 关键要点:Screenpipe 通过监听系统事件(app 切换、点击、打字暂停等)结合 accessibility tree 和 OCR 来捕捉用户活动,音频持续转录(本地 Parakeet/Whisper),所有数据索引到本地 SQLite,并开放一个带有 MCP 和 Skills 的 API 给 agent 使用。
  • 实际结论/限制:
    • 隐私方面:默认本地存储,支持 PII 自动脱敏、过滤敏感应用/URL、加密存储;但仍有用户担忧数据一旦被获取的不可控性。
    • 商业模式:采用 source-available(非 OSI 开源),从 MIT 切换后引起社区强烈反弹。个人/非商业/教育/研究免费,商业使用需付费。
    • 技术:Rust + MLX/ONNX,CPU 占用目标 <1%,内存 <400MB,支持 Windows/macOS/Linux(实验性)。

💬 讨论总结

  • 共识观点:Screen recording 类产品隐私风险极高,多数用户表示“零信任”,即使本地也存疑。但部分用户认为风险与使用 Claude Codex 等深度访问工具类似,关键在于信任和透明度。
  • 工程经验:
    • 作者选择了事件驱动 capture(监听系统事件)而非连续录制,大幅降低资源消耗。
    • 利用 accessibility tree 比纯 OCR 更高效且结构化,OCR 仅作为 fallback。
    • 与早期版本相比,CPU 使用已有显著优化。
  • 历史背景:作者此前因通过 GitHub star 收集 email 用于营销引发争议,虽然已道歉并改正,但部分用户表示无法再信任其公司。
  • 商业现实:
    • 许可证变更(MIT → source-available)被社区批评为背叛 FOSS 精神,尤其是项目早期受益于大量开源组件。
    • 建议使用 AGPL 作为中间路线:社区可自由使用,企业需付费购买商业许可。
    • 企业客户可部署 on-prem,但欧盟 AI Act 可能使欧洲企业难以采用这类持续监控软件。
  • 反对意见:
    • 有用户声称尝试自动化时 API keys 被发送到外部端点(作者解释称默认已过滤 API key,但可能配置不当)。
    • 与 Anthropic 推出的 Claude CoWork 直接竞争,后者类似但由同一家公司提供。
    • 部分评论认为“source available”让黑客无法自由修改和分享,反而容易被 AI 洗成真正开源克隆而无法维权。
    • 有用户提及“yikes”和“no sane corporation would allow this”,表达强烈不信任。

🔗 原文 · HN 讨论页

今日洞察#

几个看似独立的产品发布,指向同一个方向:AI公司正从”发布一个能对话的模型”转向”构建一个能接管具体任务的闭环系统”。推动这种转变的,不是模型能力的飞跃,而是对用户实际行为和工程约束的重新理解。

Cognition收购Poke是最直接的例证。短信Agent和编码Agent是两个完全不同的交互场景——一个极度轻量、异步、碎片化,另一个需要深度上下文和持续性执行。将它们合并到Devin中,意味着Cognition认定”Agent的能力边界不在模型能做什么,而在能接入多少种交互通道”。这种产品策略上的打通,比任何模型升级都更能改变用户的实际工作流。

Andrew Ng开源的OpenWorker则在另一个维度确认了同一趋势。它明确不绑定任何模型,允许本地运行,强调”数据仅在用户本地、LLM提供商及所选集成间流通”。当Andrew Ng这样的AI教育领袖亲自下场构建”模型无关+本地优先”的Agent框架时,传递的信号很清晰:Agent产品的核心约束已经从”模型能力够不够强”转向”能否安全可靠地在用户环境中持续运行”。隐私保护、模型切换、可控执行——这些工程问题正在取代benchmark成为决定产品命运的关键变量。

与此同时,Hacker News上的讨论暴露了更底层的成本博弈。Echo项目试图通过路由多个开源模型来复现顶级模型的性能,声称能省下2/3的成本。但讨论中反复出现的反驳是:Anthropic给大客户提供的批量折扣已经让这种路由策略在成本上不再有吸引力。更关键的是,模型间的缓存在切换时被破坏,可能抵消部分节省。这揭示了一个被忽视的工程现实:对于高频使用的Agent产品,prompt cache带来的延迟和成本优化可能比模型本身的性价比更重要。那些试图通过模型组合来降本的路由系统,正在与模型提供商自身的定价策略和基础设施优化展开一场不对称竞争。