Kimi K3 开源模型发布,Anthropic 公示开源立场
- Kimi K3 开源,2.8T 参数,Agent Arena 开源第一,定价极低
- Anthropic 发布开源立场,呼吁安全测试与来源追踪
- NVIDIA 投资 SSI,Vera Rubin 平台将带来 10 倍算力跃升
月之暗面今日开源 Kimi K3 模型,总参数 2.8T,MoE 架构,多项基准登顶(Agent Arena 开源第一),Fireworks、Vercel、Cursor 等平台数小时内接入,定价 $3/百万输入 token;Anthropic 正式发布开源权重模型立场,支持有条件开放并提出三项政策建议;NVIDIA 宣布对 Ilya Sutskever 的 SSI 进行战略投资,未来 12 个月为其提升 10 倍算力。
1️⃣ Kimi K3 正式开源:2.8T 参数开源模型,多项基准登顶#
- 核心发布:月之暗面今日正式在 Hugging Face 开放其最新旗舰模型 Kimi K3 的权重和技术报告。该模型总参数 2.8T(万亿),采用 MoE(混合专家)架构,平均激活参数未披露,但官方宣称新架构实现了“单位算力智能提升 2.5 倍”。模型原生支持 1M token 上下文窗口和视觉理解。
- 快速反响:Hugging Face 专门为其搭建了倒计时页面,发布后 30 分钟内即获 4000+ 点赞,成为当日趋势第一。Cognition 称其为“首个在我们测试中接近前沿水平的开源模型”,Guillermo Rauch(Vercel CEO)称其为“全球最强大的开源权重模型”。
- 集成生态:发布后数小时内,多个主流平台宣布支持:
- Fireworks AI 上线推理和训练服务,定价 15/百万输出 token。
- Vercel AI Gateway 支持并签署零数据留存(ZDR)协议。
- Cursor 在 CursorBench 上接近前沿,支持来自 Fireworks、Together、Baseten 的美国本地推理。
- Ollama 云上可用,可与 Claude Code 配合使用(需 Pro/Max 订阅)。
- Notion、OpenRouter 等平台均同步上线。
- 第三方评测:在 lmarena.ai 的 Agent Arena 中,Kimi K3 以 +9.75% 净改进在开源模型中排名第一,实现零工具幻觉;在 Frontend Code Arena 中排名开源第一、总榜第一,超越所有闭源模型。
- 行业意义:这是首个参数规模突破万亿级别的全面开源模型。其与北美多家主流平台的高效率集成,展示了国产模型在全球开源生态中的穿透力。低成本定价($3/百万输入,约为闭源模型 1/5 至 1/10)将直接冲击现有模型定价体系。 🔗 Moonshot 官方公告 | Hugging Face 模型页面 | Fireworks AI 定价 | Agent Arena 排名
2️⃣ [持续跟踪] Anthropic 正式发布开源模型官方立场:有条件支持开放#
- 前情提要:过去数日,由 NVIDIA CEO 黄仁勋领衔的公开信获得了包括 OpenAI、Google、微软在内数十家公司的联署,但 Anthropic 一直未表态,引发外界大量猜测。
- 最新进展:Anthropic 今日通过官方博客正式发布《Position on Open-Weights Models》,向外界阐明其对开源权重模型的完整立场。文章承认开源模型的潜在价值,但同时强调了其安全风险,并呼吁建立“更严格的发布前测试”和“可追溯的模型来源追踪”机制。该表态采取了一种中间路线:不反对开源,但要求伴随更强的安全治理。
- 社区反应:该文章发布后,X 平台上的参与度极高(433 条引用、1504 次点赞),不过部分创作者指出文章未跟进最新安全数据。
- 行业意义:Anthropic 作为 AI 安全路线最旗帜鲜明的公司,其立场对于理解未来 AI 治理格局具有风向标意义。同时,此次延迟表态也反映出公司在“安全理念”与“开源生态”之间的现实权衡。 🔗 Anthropic 官方立场文章
3️⃣ Lilian Weng 宣布关闭 AI 初创公司 Thinky#
- 核心事件:前 OpenAI 安全系统负责人、知名技术博主 Lilian Weng 今日在 X 上发表了一封公开告别信,宣布关闭她在离开 OpenAI 后联合创立的 AI 初创公司 Thinky。
- 公开信内容:Weng 在信中表示“内心很艰难”,但认为做出这个决定是正确的。她写道:“有价值的未来是人的未来。” 该条推文获得了超过 2000 个赞和大量来自 AI 社区的安慰与支持。
- 行业意义:Lilian Weng 是 AI 安全与对齐领域最具知名度的从业者之一,她的项目失败揭示了当前 AI 应用公司面临的高度不确定性和市场挑战。 🔗 Lilian Weng 推文
4️⃣ Anthropic 创始成员 Thariq 深度复盘:Claude Code 为何删除 80% 系统提示#
- 核心发布:Anthropic 创始团队成员、Claude Code 核心负责人 Thariq 今日在个人博客发布了一篇关于“上下文工程”的技术长文,系统解释了团队为何为新模型大幅精简系统提示。
- 核心发现:团队将 Claude Code 的系统提示词内容删除了超过 80%。经过内部编码评测验证,发现没有任何可测得的性能损失。Thariq 将模型的演进总结为六组对照:从“给规则”到“给判断力”、从“举例子”到“设计接口”、从“全塞前面”到“渐进式披露”等。
- 实践指引:他给出了 CLAUDE.md 的改造建议——保持轻量、信任新模型判断力、用引用代替冗长描述,并建议开发者逐条问自己:“我的规则是真的必要,还是模型一看代码就能知道的?”
- 行业意义:该文章揭示了当模型从 Claude 4 跃迁至 Claude 5 后,人类与其协作方式的底层逻辑正在发生根本性反转:以前需要写死的规则,现在成了多余的噪声。 🔗 Datawhale 译文总结 | Thariq 原文
5️⃣ GitHub Copilot 效率升级:引入提示缓存与智能模型路由#
- 核心亮点:GitHub 官方今日宣布对 Copilot 进行了重大效率升级,核心包括引入 Prompt Caching(提示缓存)和基于任务意图与模型健康度的 Auto 智能模型路由。
- 关键技术:系统搭载名为 HyDRA 的路由算法。官方评测显示,HyDRA 在匹配 OpenRouter Auto 模式 70.8% 解决率的同时,实现了 3.3 倍的成本节省。这意味着在不降低用户体验的情况下,用户的 Copilot 信用额度将更耐用。
- 行业意义:随着开发者团队每月对数百万 Agent 调用进行路由,智能缓存与路由已成为降低企业 AI 投入成本的核心手段。GitHub Copilot 此次升级首次将路由算法的对齐度与成本效率挂钩,为开发者工具树立了新标尺。 🔗 GitHub 官方推文 | 详解博客
6️⃣ NVIDIA 战略性投资 Ilya Sutskever 的 SSI:未来 12 个月算力提升 10 倍#
- 核心亮点:Ilya Sutskever 创立的 SSI(Safe Superintelligence Inc.)今日宣布与 NVIDIA 达成长期战略合作。NVIDIA 进行了一笔“数额巨大”的投资,并向 SSI 开放其下一代 Vera Rubin 计算平台。这将在未来 12 个月内帮助 SSI 将计算能力提升 10 倍。
- 信息解读:SSI 是 Ilya Sutskever 在离开 OpenAI 后创立的高度保密公司,专注于构建“超越人类智能的安全超级智能”技术路线。Ilya 在公告中明确表示:“我们的研究已经到了值得规模化的节点。”
- 行业意义:Ilya 是全球 AI 安全与对齐研究的权威。这笔投资不仅是资金注入,也意味着 NVIDIA 为前沿安全研究“站台”。对于现阶段的 AI 行业,推动“规模化验证”比“理论构想”更被资本和产业所看重。 🔗 SSI 官方公告 | 小互 精简摘要
7️⃣ 谷歌 Antigravity 新演示:实时多 Agent 协作编辑器#
- 核心亮点:Google Antigravity SDK 今日公布了一个新演示:一个基于 Antigravity 2.0 构建的 Agent,仅用 3.6 Flash 模型就在数秒内搭建出一个支持实时多 Agent 状态同步的协作版 Markdown 编辑器。
- 技术特色:该 Agent 通过 Antigravity SDK 执行任务,展示了在复杂步骤规划中多 Agent 之间的实时同步能力,表明了 Agent 在执行长链条任务时,可避免因离线或异步操作导致的状态不一致。
- 行业意义:实时多 Agent 协作是构建高级 Agentic 产品(如协同办公软件、多人游戏、共同创作平台)的关键技术。该演示证明,即使使用相对轻量的模型,正确的架构也能实现复杂的多人实时协作工作流。 🔗 Google Antigravity 演示视频
8️⃣ Microsoft 发布 MAI-Cyber-1-Flash:首款网络安全专用大模型#
- 核心发布:Microsoft AI CEO Mustafa Suleyman 今日宣布推出微软首款网络安全专用模型 MAI-Cyber-1-Flash。该模型与微软的多 Agent 安全框架 MDASH 配合使用,在 CyberGym 漏洞检测基准上得分 96%,高出 Anthropic 的 Mythos 模型 12 个百分点,成本仅为后者的一半。
- 性能特点:官方描述显示,MAI-Cyber-1-Flash 可在复杂代码库中发现最具挑战性的漏洞。MDASH 系统则利用多代理分工:由 MAI-Cyber-1-Flash 处理 90% 的常规漏洞检测任务,仅在遇到最难的 10% 时才自动调度更大的模型介入。
- 行业意义:这标志着微软在 AI 驱动安全领域的垂直整合加速。这种“小模型 + Harness 框架”的分层组合——将常规检测分配给低成本专业模型,只在疑难环节动用昂贵大模型——为安全检测领域的成本优化提供了参考范式。 🔗 Mustafa Suleyman 公告线程 | 更多详情
⭐ GitHub 趋势#
📊 类别速览
| 项目 | 类别 | Stars |
|---|---|---|
| bradautomates/claude-video | AI Agent / 工具 | 11.0k |
| mvanhorn/last30days-skill | AI Agent / 工具 | 54.2k |
| vudovn/ag-kit | AI Agent 框架 | 8.0k |
1. bradautomates/claude-video ⭐ 今日 +434#
语言/许可: Python / MIT
总 Stars: 11,044
仓库: GitHub
项目定位:
为 Claude Code / Cursor / Copilot 等 Agent 主机提供视频理解能力——自动下载视频、提取关键帧和转录文本,让 LLM 能基于音画内容回答问题。
核心功能:
- 支持 YouTube、本地文件及 50+ 视频源(通过 yt-dlp)
- 三级帧采样模式:
efficient(关键帧,0.5s 完成)、balanced(场景切换检测)、token-burner(无上限) - 内置近帧去重算法(16×16 灰度缩略图 + 平均像素差阈值),避免重复帧浪费 token 预算
- 自动优先使用原生字幕(免费),失败时回退 Whisper 转录(Groq / OpenAI)
技术亮点:
帧预算自适应策略——根据视频时长动态调整采样密度(≤30s 约 30 帧,>10min 上限 100 帧),配合 --start/--end 参数实现聚焦区域高密度采样(最高 2 fps)。
2. mvanhorn/last30days-skill ⭐ 今日 +240#
语言/许可: Python / MIT
总 Stars: 54,152
仓库: GitHub
项目定位:
面向 AI Agent 的跨平台趋势搜索技能——并行搜索 Reddit、X、YouTube、Hacker News、Polymarket 等 15+ 来源,由 Agent 法官综合评分并生成带引用的摘要报告。
核心功能:
- 零配置即可使用 Reddit、HN、Polymarket;执行一次后通过配置向导解锁 X、YouTube、TikTok、arXiv 等
- 运行
/last30days <主题>后,Agent 并行抓取各平台近期内容,按点赞数、播放量、市场赔率等真实信号排序 - 支持“发现模式”(
/last30days what's exploding in AI agents?)——自动扫描各平台热门话题,返回 5–10 个趋势主题及跟随命令 - 输出结构包含跨来源对比表格、活跃度标签、可直接引用的原文链接
技术亮点:
引入 Polymarket 预测市场赔率作为信号源,将“真金实银”的公开赌注纳入评分权重,区别于纯文本搜索的单一排序逻辑。
3. vudovn/ag-kit ⭐ 今日 +14#
语言/许可: TypeScript / MIT
总 Stars: 7,950
仓库: GitHub
项目定位:
面向 Google Antigravity(及兼容主机)的 Agent 工程套件——提供规则引擎、专家角色定义、工作流编排、持久记忆、MCP 同步和原生安全钩子,以 .agents/ 工作区契约组织 Agent 开发。
核心功能:
- 预置 20 个领域专家 Agent、47 个技能组件、13 个工作流命令(如
/plan、/orchestrate、/coordinate) - 内置持久记忆系统(4 个必输主题 + 索引),支持上下文压缩与跨会话决策保留
- 原生安全钩子:通过
PreToolUse机制拦截高风险命令(如rm -rf /),同时允许正常项目清理操作 - 提供 MCP 配置同步工具(
sync-mcp.mjs),支持备份、检查、打印三种模式,避免直接向 home 目录写入凭据
技术亮点:
采用 SemVer 合约管理所有 Agent、技能、工作流和规则,通过 manifest.json + 依赖图实现可复现的 Agent 工作区,可检测版本漂移并支持合并式安全升级与回滚。
🟧 Hacker News 热议#
Our position on open-weights models#
313 pts · 372 comments · anthropic.com
📌 内容总结
- Anthropic CEO Dario Amodei 针对近期关于“封禁开源权重模型”的舆论发表澄清。否认 Anthropic 主张全面封禁,但提出了三个替代政策方向。
- HN 关注点:
- 文字否认封禁,但提出的三项政策(芯片出口管制、打击蒸馏、强制安全测试)在社区中被普遍解读为事实上的竞争壁垒。
- 文章核心矛盾在于:Anthropic 自身大量使用受版权保护的数据训练模型,同时要求政府打击他人对其模型的“蒸馏”行为。
- 安全测试标准由谁制定、谁来执行、测试结果如何影响发布,文中均未明确,被指为预留了封禁后门。
💬 讨论总结
-
共识:这是变相的反竞争行为
- 多数高赞评论认为,Anthropic 的立场本质上是通过政策手段削弱竞争对手,尤其是 DeepSeek 等中国开源模型。
- 典型观点:“不是封禁开源模型,只是封禁竞品。” 大量评论指出,Anthropic 要求政府介入的每一项政策(芯片、蒸馏、测试)都会让仅有开放模型的小公司和研究者难以生存。
-
核心分歧:安全风险 vs. 市场保护
- 支持方论点:认为文章逻辑一致。Dario 一直公开担忧生物/网络攻击风险,要求对所有足够强的模型(包括自己)进行测试是合理的。不能因为封禁会伤及竞品就放弃必要监管。
- 质疑方核心反驳:
- 嘴离间:一边花 15 亿美元和解版权诉讼,一边要求打击“蒸馏”——评论普遍认为这是“我拿了你的是创新,你拿了我的叫盗窃”。
- 对“安全测试”的担忧:测试标准由谁定?如果由美国政府或 Anthropic 支持的机构执行,结果必然是封禁开源模型。历史经验(如密码学出口管制、FDA 审批)表明,监管门槛往往成为大公司护城河。
- 对中国风险的双标:多条评论指出,美国军方(Project Maven)已在用 Anthropic 模型,而文章将中国模型定义为“专制压迫工具”,忽略了美国自身的军事化 AI 部署。
-
工程经验与历史背景
- 多条评论回顾了 1990 年代美国试图禁止强加密的失败,指出 AI 模型更难隐藏,但开源社区仍有空间。
- 部分评论指出,Distillation 在技术上比从头训练高效得多,但也必须承认——如果没有蒸馏,许多小型研究机构根本无力跟进前沿能力。
- 生物风险方面,有评论质疑 Dario 所说的“疫情级病毒武器化”场景过于科幻,认为当前 LLM 连实验室操作都无法可靠执行。
-
风险/限制
- 社区普遍认为,一旦“安全测试”成为法律要求,深度开源模型将基本消失——因为发布者无法承担后续安全责任。
- 芯片出口管制方面,有评论指出中国已发展出自己的芯片生产链,仅靠出口管制已不足以阻止其模型能力提升。
Show HN: FeyNoBg – Automatic background removal model and training library#
82 pts · 21 comments · usefeyn.com
📌 内容总结
- 作者想做什么:训练并开源一个 SOTA 背景移除模型(FeyNoBg)以及配套的训练库(NoBg),让开发者能直接使用或自行微调模型。
- HN 关注点:
- 基于 BiRefNet 架构,在 8 个基准上 4 个领先、其余 4 个差距不超过 2%。模型大小从 222M 增至 263M 参数。
- 技术核心:扩展特征提取器的第三阶段(18→24 块)以平衡前景识别与边界精度的 trade-off,并精心混合 10 个训练数据集以解决以往“此消彼长”的问题。
- 开源内容包括:Hugging Face 模型、PyPI 包(
nobg)、GitHub 仓库,但模型权重使用 CC-BY-NC 4.0 许可证。
💬 讨论总结
-
积极反馈为主,社区认可度高
- 多条评论对模型质量表示肯定,认为背景移除是“与语音转文字同等重要”的基础功能,且这个领域正在快速成熟。
- 开发者本人积极参与回应,讨论了分辨率限制(运行时按 1024 缩放,掩码后恢复到原图)、移动端部署的可能性,并欢迎贡献。
-
技术讨论集中在两个方向
- 与 Adobe / remove.bg 的对比:有用户提出实际场景中“什么是主体”的歧义问题(如坐在沙发上的人,能否只切人不切沙发)。作者回应称当前是自动模型,会包含所有前景元素;后续计划推出基于 prompt 的版本,用户可指定要保留的物体。
- 许可证争议:多个评论指出 BiRefNet(基座模型)使用 MIT 许可证,但 FeyNoBg 的权重使用 CC-BY-NC,这限制了商业使用。作者解释称,这是因为“署名使用正在减少”,希望确保公司使用后给予 credit。部分评论反驳认为这会阻碍采用,推荐使用其他许可更宽松的模型(如 S3OD、BEN)。
-
工程经验
- 作者训练策略的关键洞察:前景分割和边缘 matting 是互斥技能,盲目扩大训练数据会导致一个技能退步。他们通过精心挑选 10 个数据集(26.1K 图像)并做每源上限 4000 张的裁剪来平衡。
- NoBg 库被设计为统一接口,支持开箱即用的训练 pipeline,比原始 BiRefNet 实现内存更低、吞吐更高。
-
反对/质疑
- 主要来自许可证问题:部分用户明确表示“不会采用 CC-BY-NC 的模型”,因为会给项目引入法律风险。
- 一条被标记的 AI 生成评论引发了关于社区规则的讨论。
今日洞察#
开源模型首次在参数规模上穿透万亿级前沿,且定价直接腰斩闭源。 Kimi K3 是第一个总参数量突破万亿的全面开源权重模型,更关键的是它在多个基准(Agent Arena、Frontend Code Arena)上超过了所有闭源模型。Fireworks 定价 $3/百万输入 token,约为 GPT-4o 的 1/10,Claude Sonnet 的 1/5。过去开源模型常被诟病“只能做小任务”,Kimi K3 把“开源”和“前沿能力”两个概念第一次挂钩。CN 模型的全球集成速度(Fireworks、Vercel、Cursor、Ollama 均在数小时内接入)也说明,平台层对低成本高能力模型的渴求远超地域偏好。
Anthropic 的开源立场,本质上是在给“安全测试”这个路径贴双重标签。 文章文字上否认全面封禁,但三项政策——芯片出口管制、打击蒸馏、强制安全测试——在 HN 社区被普遍解读为变相削弱对手。最尖锐的矛盾在于:Anthropic 自身用版权数据训练模型,却要求政府禁止他人蒸馏其模型。如果安全测试标准由大国政府部门主导,结果很可能是只有合规成本极低的大公司(如 Anthropic/OpenAI)才能通过。1990 年代强加密出口管制的教训是:监管门槛最终成了大公司护城河,而非真正的安全屏障。
Claude Code 删掉 80% 系统提示的案例,暴露了“提示工程”正在从写规则退化为设计接口。 Thariq 的实验表明,当模型从 Claude 4 跃迁到 Claude 5 后,原先精心编写的规则变成了噪声。这揭示了一个深层变化:模型自身的判断力正在吃掉大量显式指令的空间。团队不再给出具体步骤,而是给出“接口”和“判断力”。这种转变意味着 Agent 开发者的技能重心将从“提示词文案”转向“交互边界设计”——如何用最少的指令让模型自主决策。对于依赖 prompt 模板的中间商来说,这是一个结构性风险。