AI前沿日报:2026-09-11

今日主线:agent 基础设施开始被平台化收编。OpenAI 一天之内把 Codex 的托管运行时、全双工语音层和企业数据/金融工作流全部推上 API;Cognition 用一个中国开源底座把编码模型的性价比推到前沿的四分之一;而在算力侧,中国 GPU 公司完成资本化、TPU 的推理经济性被第三方量化、SpaceX 用一份月付 11 亿美元的合同说明「算力出租」已经成为独立生意。

今日最重要的 10 件事

1. OpenAI 发布 Agents API 公测:把 Codex 的托管运行时变成一行 API 调用

  • 发生了什么:OpenAI 把驱动 Codex 的 agent 运行时(harness)与基础设施做成公开测试版 API。开发者一次调用即可指定任务、模型、工具与运行环境,由 OpenAI 负责模型调用、工具使用、任务编排、长时会话与上下文管理。运行环境可选 OpenAI 托管沙箱、自建基础设施(含自有 VPC)或九家沙箱合作方:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel。能力上支持 MCP 工具、自动上下文压缩、工具检索与最多 3 个并发子 agent;官方称调用本身不额外收费,按 token 与工具消耗计费。
  • 为什么重要:过去一年 agent 工程最难的部分不是模型,而是上下文管理、沙箱隔离、长时任务可靠性与子 agent 编排——这些正是「harness 层」。OpenAI 把 Codex 内部打磨出的 harness 直接对外售卖,等于宣布这一层不再由框架厂商自建,而是由模型厂商提供。这与「模型即服务」的下一步形态一致:卖的不是 token,而是能持续跑几天的执行环境
  • 影响对象与后续观察:Agent 框架(LangGraph、CrewAI 等)与沙箱/运行时厂商的定位会被重新划分;企业采购需要重新评估自建 harness 的成本。观察点:托管沙箱与自建环境的可靠性差异、子 agent 并发上限是否成为瓶颈、以及九家合作沙箱之间的定价与地域分布差异。

2. GPT-Live-1 进入 API:全双工语音每分钟 0.05 美元

  • 发生了什么:GPT-Live-1 面向开发者开放,单个模型同时完成听与说,取代「语音识别 + 推理模型 + 语音合成」的级联架构;推理与工具调用可委派给后端文本模型(示例中是 GPT-6 Astra 或 Luna)。官方称在 Full Duplex Bench 上相比 GPT-Realtime-2.1 提升 30 个百分点,搭配 GPT-6 Astra(medium effort)后在 Tau3 语音 agent 智能评测中排名第一;同时支持电话场景、背景噪声与停顿处理,并新增一批跨口音/语言的声音。定价为前端语音层每分钟 0.05 美元。
  • 为什么重要:语音一直是 agent 体验最割裂的一环——每一级级联都带来延迟与「抢话」错误。全双工把语音层压成单一模型后,语音 agent 的架构复杂度与成本结构同时下降。参考客户给出的量化结果很直接:一家医疗场景公司称代码量减少 80%、删除约 2.3 万行;语言学习产品称思考停顿时的误打断减少近 80%。
  • 影响对象与后续观察:语音客服、外呼、无障碍与语言学习是最先被改写的一批产品;语音中间件(ASR/TTS 拼接层)的价值被压缩。观察点:真实通话中的延迟与打断恢复表现、每分钟计费与后端推理成本叠加后的总拥有成本、以及非英语口音的实际质量。

3. ChatGPT for Financial Services 与 Data agent:企业工作流被同时推进

  • 发生了什么:OpenAI 同日推出两款企业向能力。其一是 ChatGPT for Financial Services,与摩根士丹利、Evercore 联合设计,内置 Daloopa、PitchBook、LSEG News 等付费数据并由 OpenAI 索引托管,以支持可回溯到原始文件的细粒度引用,能力覆盖估值分析、LBO 建模、买方筛选、财报分析与 pitchbook 制作,由 GPT-6 Astra 驱动。其二是 ChatGPT Work 中的 Data agent:连接 Redshift、Datadog、BigQuery、ClickHouse、Databricks、MongoDB、Snowflake 等已批准数据源与 Drive/SharePoint 文件,借助 dbt、Databricks Genie Ontology、Snowflake Horizon 等语义层理解业务口径,查询继承既有表/行/列权限,产出可编辑分享的交互式看板,并可与 Power BI、Tableau、ThoughtSpot 等 BI 工具联动。
  • 为什么重要:这两条线的共同点是「把数据与权限先搬到模型侧」——金融版由 OpenAI 托管数据索引,Data agent 则把企业语义层接进来。模型厂商正在把自己插入到企业数据与工作流的中间层,而不是只提供推理能力。OpenAI 称内部几乎所有产品团队与三分之二以上的 GTM 团队已在使用同类数据 agent 能力,这既是产品验证,也是销售话术。
  • 影响对象与后续观察:金融数据供应商、BI 工具、企业数据目录与权限治理产品都会感受到压力或机会。观察点:数据托管引发的合规审查(数据驻留、审计日志)、细粒度引用在监管场景下的可接受度,以及 BI 厂商是被集成还是被替换。

4. Anthropic 9 月威胁情报报告:AI 从「辅助攻击」变成攻击的执行者

  • 发生了什么:报告覆盖 2025 年 12 月至 2026 年 8 月被阻断的滥用行为,分七个领域:网络行动、影响力行动、监控、诈骗与欺诈、生物滥用、常规武器开发与非法蒸馏。最受关注的是被追踪为 GTG-20006 的行动:其手法与微软追踪的、被美方与俄罗斯 SVR 关联的 Midnight Blizzard 一致,用定制 AI 工作流完成目标研究、钓鱼基础设施配置、入侵执行、凭据收集、横向移动与数据整理,涉及 20 多个组织;报告还描述了能监测「我方恶意代码是否被安全产品发现」并据此改写重建直到绕过检测的智能体。另有七家中国实验室被指对 Claude 公开模型进行未经授权的规模化能力提取(工业级蒸馏)。
  • 为什么重要:这份报告的分量不在「AI 被滥用」这一判断,而在细节:AI 承担的是编排与迭代(检测规避循环),这恰好是过去只有成熟攻击团队才具备的能力。同时 Anthropic 明确说明报告不代表滥用全貌、样本是「最值得披露的案例」,并承认数据边界来自自家遥测——这既是坦诚,也提醒读者它的结论不能外推为行业全貌。
  • 影响对象与后续观察:企业安全运营、检测规则供应商、以及所有提供编码/agent 能力的厂商。观察点:蒸馏指控是否会出现可独立复核的技术证据(而非厂商单方面认定)、被点名方是否回应、以及「agent 自行改写恶意代码直到免杀」是否在其他实验室的遥测中被复现。

5. Cognition 发布 SWE-2:中国开源底座 + 自研 RL,把前沿编码能力压到四分之一价格

  • 发生了什么:SWE-2 在 FrontierCode 1.1 Main 得 50.0%(Fable 5.1 为 50.9%,GPT-6 Astra 为 53.3%),DeepSWE 1.1 为 73.0%,Terminal-Bench 2.1 为 92.8%。官方称比 Fable 5.1 便宜 64%,性能接近 GPT-6 Astra 而成本约为其四分之一;在 FrontierCode 上,SWE-2 medium 的得分高于上一代 SWE-1.7,平均轮次从 127 降到 53、成本低 81%。技术关键是把 RL 扩展到万亿参数级,并在单次训练中同时优化所有 reasoning effort 档位、对每档施加按帕累托前沿斜率标定的线性成本惩罚。底座是 2.8T 参数的中国开源模型 Kimi K3,官方称 RL 仍在 K3 之上带来 5–6 个百分点增量。SWE-2 已在 Devin Desktop、CLI、Web 与 Fusion 上线。
  • 为什么重要:这是三层信号叠加——其一,编码模型竞争从「谁最聪明」转向「单位任务成本」;其二「中国开源权重 + 美国公司后训练」的产业分工已经出现在最前沿的编码模型上;其三,Cognition 证明在开源底座上做 RL 仍有显著头部空间,这会让基座开放者的定价权与闭源前沿的溢价同时承压。
  • 影响对象与后续观察:编码 agent 定价、Devin 与竞品的销售策略、以及依赖「模型能力溢价」的厂商。观察点:第三方在 FrontierCode/DeepSWE 上的复现结果、Kimi K3 的许可条款对商用后训练的限制边界,以及前沿实验室的下一版编码模型是否会把价格拉回。

6. TPU 推理经济性被第三方量化:Ironwood 每百万 token 成本低于 B200/B300

  • 发生了什么:首份针对 TPUv7 Ironwood 的第三方推理测算显示,在 100 tokens/s/用户 的交互强度下,每百万 token 总成本约 0.181 美元,B200 为 0.222 美元、B300 为 0.276 美元,同等负载下每美元性能最高领先 B200 约 50%、领先 B300 约 96%;优势主要来自更低的每小时租赁成本而非物理吞吐。文章同时讨论了 TorchTPU 通过 PyTorch 的 PrivateUse1 后端让 TPU 成为原生 Torch 设备(取代此前的翻译层),以及 Anthropic 作为 TPU 最大用户的采购结构。
  • 为什么重要:CUDA 护城河的实质是「迁移成本」,而迁移成本的墙脚正被原生 PyTorch 支持与可核验的成本数据同时挖开。对推理密集型企业,这意味着加速器选型第一次有了可对比的第三方成本曲线,而不是只有厂商 PPT。
  • 影响对象与后续观察:云与推理服务商的单位经济学、模型服务商的毛利结构、以及自建推理集群的采购决策。观察点:agent 类多轮负载(而非单 token 预测)下的对比、投机解码与分离式预填充在 TPU 上的成熟度,以及这份测算是否被其他第三方复现。

7. 国产 AI 芯片资本化收官:燧原科技科创板首日高开 188%

  • 发生了什么:燧原科技(688801)以 142.18 元/股发行,首日开盘 410 元、较发行价上涨 188.37%,开盘市值超过 1700 亿元,实际募资约 61.19 亿元,主要投向第五、六代 AI 芯片研发产业化与软硬件协同创新。至此摩尔线程、沐曦股份、壁仞科技、燧原科技四家国产 GPU 公司均已完成科创板上市。
  • 为什么重要:一级市场融资 → 二级市场募资的通道打通后,国产算力的约束从「拿不到钱」变成「交付与生态能否跟上」:芯片要按代际持续投入,软件栈(编译器、算子、框架适配)需要长期烧钱而难有短期收入。四家同时上市意味着这一板块在资本市场内开始相互比较,而不再只与「英伟达替代叙事」比较。
  • 影响对象与后续观察:国产芯片的下游云厂商与模型公司、智算中心采购、以及配套的软件与互连供应链。观察点:募资落地后的量产节奏、软件栈第三方评测、以及各家在推理(而非训练)场景的实际交付量。

8. 中科曙光 IBGDA 在十万卡级集群完成规模化验证

  • 发生了什么:中科曙光发布 scaleFabric 词元加速技术体系,以原生无损 RDMA 网络构建「算存传」三级紧耦合通道;其中支持 GPU 直接发起网络通信的 IBGDA 实现在国内首次规模化落地,已在十万卡级大规模集群完成验证,并完成 DeepEP 等通信框架适配,同时引入存储直通等路径优化以缩短词元生成时延。此前 IBGDA 的规模化落地主要由国际厂商主导。
  • 为什么重要:当 MoE 成为主流架构,通信成为推理效率的第一瓶颈——IBGDA 的价值恰在于减少 CPU 介入关键通信路径。国产算力的竞争维度已经从单卡算力转到了「互连 + 调度 + 可靠性」的系统工程,这类能力的可验证性也高于纸面参数。
  • 影响对象与后续观察:国产智算中心的实际吞吐与利用率、MoE 推理的部署成本。观察点:第三方集群上的端到端吞吐数据、与 DeepEP 之外的框架(如 vLLM/SGLang 生态)适配进度。

9. 中国开源三连发:京东交互式世界模型、宇树具身基座、蚂蚁多模态与轻量世界模型

  • 发生了什么
    • 京东 JoyAI-EchoWM(JDD 2026 发布并开源):在同一框架内生成视频与环境音、音乐、语音,并实时响应用户操作;用统一「相机意图」表示把键盘操作映射为连续 6-DoF 轨迹,第一人称与第三人称共用控制接口;官方称在 158 个 WBench Navigation 案例上取得 81.7 平均分,同时放出更轻量的因果流式变体。局限是没有显式持久三维记忆,长时生成仍可能漂移。代码与权重在 JoyAI-Echo 仓库。
    • 宇树 UnifoLM-WLA-1.0:6B 参数、约 2500 小时真机数据训练的通用人形机器人基础模型,代码、模型与数据集同步开放;单模型统筹 10 项全身操作与 54 项桌面操作,覆盖平行夹爪与两类灵巧手,把末端执行器位姿与关节动作经残差向量量化转为离散 token 以统一动作空间,并引入以交互为中心的区域预测;对应权重已出现在 Hugging Face(UnifoLM-ER-1 / ER-Flow),第三方量化版本同日跟进。
    • 蚂蚁两条线:Ling-3.0-flash-VL(124B 总参、5.5B 激活的原生多模态模型,256K 上下文,视觉反馈闭环,官方称图片转网页评测得分高于 GPT-5.4)与灵波科技 LingBot-World 2.0 的三款新开源世界模型(1.3B Small 可在消费级单卡实时生成、Bidirectional 教师模型、Causal Pretrain 基座)。
  • 为什么重要:三条线共同把「世界模型 / 具身基座 / 原生多模态」从论文级概念推到可下载、可二次开发的开源件,并且都在强调同一件事——闭环(视觉反馈、区域预测、交互控制)。开源在中国的落地方式正在从「开源一个大模型」转向「开源一整套闭环训练与数据资产」。
  • 影响对象与后续观察:具身智能创业公司(数据与基座成本被显著压低)、游戏与自动驾驶的仿真数据生产。观察点:这些模型的许可条款是否允许商用、第三方复现的评测结果、以及「无持久三维记忆」这类结构性局限何时被解决。

10. SpaceX 再签 AI 算力托管大单:12 月起月收入约 11 亿美元

  • 发生了什么:SpaceX 首席财务官在投资者会议上披露新签 AI 算力托管协议,预计自 12 月 1 日起每月带来约 11 亿美元新增收入(约合每年 133 亿美元),公司对年底达成 1000 亿美元 ARR 目标表示有信心。此前 SpaceX 已与 Anthropic、Google 等签署算力协议。
  • 为什么重要:把发射公司变成 AI 算力房东,是这轮 AI 资本结构最反直觉的变化:稀缺的不是模型,而是电、机房与并网许可,谁先锁定这些资源,谁就能以「月付合同」把未来的模型竞争变成自己的现金流。这也意味着 AI 收入预期正在被写进非 AI 公司的估值里。
  • 影响对象与后续观察:数据中心 REIT、电力与冷却供应链、以及需要在 IPO 前建立算力叙事的公司。观察点:这类长期合同的违约与重议条款、实际交付上线的时点,以及算力出租收入的会计确认方式。

大模型与 API 更新

  • OpenAI Agents API(公测):把 Codex harness 作为托管服务开放,支持托管沙箱、自建 VPC 与九家沙箱合作方,内置自动上下文压缩、工具检索、MCP 工具与最多 3 个并发子 agent;调用本身不额外收费,按 token 与工具计费。含义:harness 从「每个团队自己造」变成可采购的标准件。
  • GPT-Live-1(API):全双工语音模型,前端语音层每分钟 0.05 美元,推理与工具调用交给后端模型;官方称 Full Duplex Bench 相比 GPT-Realtime-2.1 提升 30 个百分点。
  • ChatGPT for Financial Services:与摩根士丹利、Evercore 联合设计,内置 Daloopa、PitchBook、LSEG News 数据并支持细粒度引用,由 GPT-6 Astra 驱动。
  • ChatGPT Work Data agent:连接主流数仓与 BI 工具,借助语义层理解业务口径,权限继承既有表/行/列规则,输出可分享的交互式看板。
  • OpenAI 政府版扩容:与美国 GSA 达成多年协议,联邦/州/地方/部落政府免许可费(原价每月每用户 15 美元)、用量五折,覆盖约 2300 万公共部门人员;经核验的政府机构可按五折获得 Daybreak Blue 网络安全防御访问权。
  • Claude Code 2.1.268:新增组织策略诊断(/status 与 claude doctor 说明策略为何加载失败)、把命令与后台任务的内联输出上限提高到 128K 字符、增加 --append-subagent-system-prompt-file、新增 /skill-doctor 显示未被使用却占用上下文的技能。企业管控与上下文成本透明度成为编码智能体的新竞争面。
  • Cognition SWE-2:FrontierCode 1.1 Main 50.0%、DeepSWE 1.1 73.0%、Terminal-Bench 2.1 92.8%,后训练自 Kimi K3(2.8T),单次 RL 训练覆盖全部 reasoning effort 档位并施加按前沿斜率标定的成本惩罚,已在 Devin 全端上线。
  • 蚂蚁 Ling-3.0-flash-VL:124B 总参 / 5.5B 激活,256K 上下文,原生图像、文本与视频输入,42 层 KDA 与 Gated MLA 交替(5:1)主干,引入视觉反馈闭环;官方称图片转网页评测(Image-to-WebDev Arena,代号 linthium)得分高于 GPT-5.4,多模态联合训练让文本能力在 Artificial Analysis 指数上提升 4 分。BF16/FP8 权重已开放。
  • LingBot-World 2.0 三款世界模型开源:1.3B Small 面向消费级单卡实时生成,Bidirectional 作为高质量蒸馏源,Causal Pretrain 支持相机位姿与文本双输入。
  • Mistral 与 Cloudera 达成战略合作(09-10):在企业数据所在的混合云环境内运行 Mistral 模型,主打「数据不出域」的部署路径——与 OpenAI 把金融数据索引托管到自家平台的路线形成对照,企业采购将在这两条合规代价不同的路径间做选择。
  • API 侧观察:今天的更新几乎全在「能力之外的层」——运行环境、语音层、数据连接、权限与治理。模型版本号没有变化,但可用性边界被明显推开。

论文与研究前沿

  • Subagents vs Agent Skills(2609.09233):系统比较长时程任务中「多子智能体分工」与「可复用技能」两种组织方式,回答一个工程上每天都要决定的问题:该拆 agent 还是该沉淀技能。
  • 前沿规模的护栏有多脆?对 320B MoE 的单方向攻击(2609.09793):以一个方向性扰动攻击大规模 MoE 模型的安全对齐,属于本周最值得安全团队读的论文。
  • AgentHijack:多模态计算机操作智能体的视觉补丁攻击(2609.09212):把攻击面放在「屏幕上看到的像素」而不是文本提示,指向 GUI agent 的真实风险路径。
  • Black-Box Red Teaming of Agentic AI(2609.09647):给出面向智能体的黑盒红队分类框架与自动化风险发现流程,是评测工程化的一步。
  • AgentAudit(2609.09875):面向 AI 智能体全生命周期信任评估的开放可扩展框架,与近期实验室层面的审计事件形成呼应。
  • OpenDiscoveryTrace(2609.09203):用过程轨迹(而非只看结论分数)评估「AI 科学家」工作流,直接回应「分数不能证明发现」的方法论问题。
  • Do Agents Know When They Succeed?(2609.09448):从内部表征校准智能体置信度,让 agent 能判断自己是否真的完成了任务。
  • What Should an Agent Forget?(2609.10263)与 Fortunate Recall(2609.10413):分别研究「存储」与「使用」的分离,以及本体驱动的记忆生命周期管理——长期记忆正在从「向量库」变成有淘汰与一致性语义的系统组件。
  • Consort:面向活数据库分支的规范优先智能体框架(2609.09671):把强制测试驱动开发写进框架约束,是「用工程规范约束 agent」路线的代表。
  • A-JIT:智能体即时软件构建(2609.10248)与 The Vibe Shift in Software Engineering(2609.09560):一篇讲构建方式,一篇用实验评估对话式编程在性能、认知负担与结果上的真实表现——后者的价值在于给出了可量化的对照数据。
  • Cyber-Financial Contagion(2609.10350):建模「AI 供应商被攻破」如何通过银行体系传导,把模型供应链风险第一次放进金融传染模型里。
  • Watermarks Without Verification(2609.09604):欧盟 AI 法案背景下,讨论 AI 文本水印「有标记但无法验证」的现实处境。
  • Beyond Training: Inference-Time AI Governance(2609.10105):把治理手段从训练侧移到推理侧,给出可行性分类,是监管可操作化的一条现实路径。
  • UnitBoost(2609.09815):用「合并算子」而不是再训练一个模型来管理复合 LLM 系统,直指多模型编排的运维成本。
  • 推理与压缩一组:Scaling Post-Training Ternarisation to Qwen3-8B(2609.09240,三值化后训练的可复现流程与打包执行)、Distribution-Consistent Inference for Dynamic Sparse MoE(2609.09241)、KV cache 拼接感知微调 vs 重算(2609.09768)、Forward-Free LLM Depth Pruning(2609.09883)、Looped GPT-BERT(2609.09691,用循环换参数)。共同指向同一个事实:推理成本的核心仍在缓存与稀疏路由。
  • 安全与合规组:In RAG We Trust?(2609.09243,文档投毒下检索增强生成的鲁棒性)、Arbitrary Cipher Attacks Against LLMs(2609.09553,无需微调的密文攻击)、Multimodal Prompt Injection on Agentic AI Frameworks(2609.09404)、CS-Guard(2609.09798,代码生成安全护栏基准)、Active Adaptation 而非静态防御(2609.10142,对抗微调下的预防性引导时序)。
  • VANTAGE-Bench(2609.09396):评测视觉语言模型在基础设施运维场景中的能力缺口,把 VLM 拉进「看图处理真实工程」的考场。
  • 网络运维智能体:Artifact Drift 的检测与修复(2609.09849)与跨权限边界交付可验证结果(2609.10181),两篇都在试探「agent 能不能对生产网络负责」的边界。
  • No Free Checker(2609.09250):机器人策略验证器综述,提醒「用另一个模型给机器人打分」并非免费午餐。
  • 其他值得一读:Strangers to Themselves(2609.09899,模型对自身的描述高度泛化)、Pairit(2609.09789,人机协作在线实验平台)、CityPlanner(2609.09578,可执行城市规划沙盒智能体)、AgenticGen(2609.09187,奖励引导的广告视频生成)、Compact Visuotactile World Models(2609.09597)、Valerant(2609.09418,动作条件世界模型生成可导航游戏地图)。来源依次见 arXiv 当日公告。

开源项目与 GitHub 热点

  • llama.cpp 日更构建 b10905:本地推理主线维持每天多次构建,本周持续跟进新模型与多模态输入路径。含义:本地推理的「适配周期」已经压缩到天级,自托管用户的实际瓶颈转向显存与量化质量。
  • OpenAI Codex CLI 0.155.0-alpha 与 Python SDK 0.154.0:Codex 侧 CLI 与 SDK 同日双线更新,与 Agents API 公测形成配套(harness 托管化后,本地 CLI 仍是开发与调试入口)。
  • openai-python v3.13.0:官方 Python SDK 连续两日更新(09-10 的 v3.12.0 与 v3.13.0),通常对应 API 侧新能力与参数变化;接入 Agents API 的团队应锁定版本。
  • n8n 2.39.4 / 2.38.7 双线发布:工作流自动化平台同时维护两条小版本线,企业侧 agent 编排的更新节奏已经与 SaaS 产品同级。
  • Cline Desktop v0.0.26:开源编码智能体的桌面端继续快速迭代,与云端 harness 形成「本地优先」的对照路线。
  • Gemini CLI v0.61.0-nightly:命令行智能体维持每日构建节奏,三家 CLI 智能体的竞争点正在从模型转向工具权限与会话管理。
  • RAGFlow v0.27.2 / Lightning 2.6.6 / langchain-anthropic 1.7.2 / Zed v1.19.2:RAG 平台、训练框架、Anthropic 集成包与编辑器同日更新,属于生态适配层的常规推进,但对锁定这些组件的团队仍是必读的变更。
  • 社区热项Nine coding harnesses vs. your laptop 用同一台笔记本横评九种编码 harness(安装、占用、任务完成度),是比发布会材料更接近真实体验的一手对比;Training a 3.8B LLM to 0.384 CORE for $998 公开了完整配方与成本,为「小模型能力天花板」提供了可复现的基线。

Hugging Face 模型、数据集与 Demo

  • DeepSeek-V4.1-Flash 稳居趋势榜首位:单日点赞增长最快,配套 GGUF/量化生态仍在生成,说明「轻量版本反超旗舰」的架构路线正在被社区大规模下载验证。
  • 蚂蚁 Ling-3.0-flash-VL(BF16 / FP8 / FP4 / INT4):官方同步放出多精度版本,社区 CPU/单卡适配版(GGUF、NVFP4)已跟进,端侧多模态的可用性明显改善。
  • 宇树 UnifoLM-ER-1 / UnifoLM-ER-Flow:具身基础模型权重上线首日即出现第三方 GGUF 转换,具身模型的社区适配开始复制语言模型的路径。
  • m-a-p/YuE2-3B:带符号规划的开源音乐生成模型进入趋势榜,走「先规划曲式再渲染音频」的两段式路线,是开源音乐生成对商业模型(Suno 等)的主要对照。
  • Nex-N2.5-mini / Pro:面向编码与 computer use 的开放权重家族继续获得下载与点赞,与 Pro 版一起构成小尺寸高能力的选择集。
  • Qwen3.8-27B 的量化新格式(GSQ-RCO-GGUF):学术团队用新量化格式争夺本地部署空间,量化竞争已从位宽转向算法与格式创新。
  • IBM Granite Time Series PatchTST-FM-r2:以商业友好许可发布的时间序列基础模型,企业预测场景的低调入口——许可条款放宽对采用率的影响往往大于指标提升。
  • Hugging Face 博客:用 Gradio Workflow 重建 AUTOMATIC1111 界面:演示把复杂推理后端包装成可视化工作流,生成式应用的前端层正在与推理栈解耦。

Agent / AI Coding / 开发工具

  • Agents API 的九家沙箱合作方:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel——「沙箱」这一层被明确列为可替换组件,意味着执行环境正在成为标准化市场,而不是各框架的私有实现。
  • 自适应 harness 研究升温:RobustSGPO(2609.09646)研究 harness 演化的搜索空间控制,与 HN 上关于「约束型技能文件」的讨论合流——harness 已从工程细节变成独立研究方向。
  • Consort / A-JIT / Spec-first 路线:把测试与规范前置为框架的强制约束,是对「agent 写完就不管」的直接工程回应。
  • GitHub Copilot 官方教程转向「审阅回路」:新教程教用户看 diff、用终端、在浏览器里验证,而不是写提示词;产品重心从生成转移到验证。
  • Cognition 与 GPT-Live-1 的组合:Cognition 作为语音客户出现在 GPT-Live-1 发布材料中(「与 AI 工程师协作更像和队友讨论」),说明编码智能体的交互形态正在向语音与实时协作扩展。

多模态、视频、语音、图像

  • GPT-Live-1 新声音与电话支持:从少量实时音色扩展到跨口音、跨语言的一批声音,并明确支持电话部署(餐厅预订、客服等),语音 agent 的商业场景被直接点名。
  • 京东 JoyAI-EchoWM:视频 + 环境音 + 音乐 + 语音同框架生成,并把「键盘输入→6-DoF 相机轨迹」做成统一控制接口,第一/第三人称共用;WBench Navigation 158 案例平均 81.7 分。局限是无显式持久三维记忆。
  • Ling-3.0-flash-VL 的视觉反馈闭环:观察输出→比对目标→识别偏差→自主调整,把多模态从「一次生成」变成可自检的过程,图片转网页与 GUI 操作是最直接的应用面。
  • 语音研究:Voice or Stereotype?(2609.09263)解耦语音转语音模型中的声学特征与内容刻板印象;NOPE-HYPE(2609.10058)给出跨多样声学环境的鲁棒语音识别仿真工作流。
  • 视频与世界模型研究:Compact Visuotactile World Models(2609.09597)把力约束纳入触觉世界模型;Valerant(2609.09418)用动作条件世界模型探索自动生成可导航游戏地图;AgenticGen(2609.09187)用奖励引导的智能体流程生成广告视频。

算力、推理、芯片与基础设施

  • TPU Ironwood 推理成本测算:每百万 token 约 0.181 美元(B200 0.222、B300 0.276),每美元性能最高领先 B200 约 50%、B300 约 96%,优势来自更低的每小时租赁成本;TorchTPU 正在把 TPU 变成原生 PyTorch 设备。
  • 中科曙光 scaleFabric + IBGDA 十万卡验证:GPU 直接发起网络通信在国内首次规模化落地,适配 DeepEP 并引入存储直通,降低 MoE 通信中 CPU 介入的路径开销。
  • 英伟达生态两条线:Skild AI 用物理 AI 让机器人从单段视频学习新任务;d-Matrix 采用 NVLink Fusion 做机架级 XPU 部署——即便算力来自别家,机架内互连标准仍留在英伟达体系内。
  • SpaceX 算力托管合同:12 月 1 日起每月约 11 亿美元新增收入(约年化 133 亿美元),公司对年底 1000 亿美元 ARR 目标表示乐观。
  • 本地算力硬件:System76 推出 192GB 显存的 Thelio Mira AI Linux 工作站,面向本地推理与微调;当开源模型规模继续上升、云端推理成为长期支出时,本地工作站重新变成可计算选项。
  • 基础设施 AI 能力评测:VANTAGE-Bench(2609.09396)专门度量视觉语言模型在基础设施运维中的能力缺口——「模型能不能看懂机架与拓扑」正在成为独立评测方向。

中国 AI 动态

  • 燧原科技科创板上市:首日开盘 410 元(发行价 142.18 元)上涨 188.37%,开盘市值超 1700 亿元,募资约 61.19 亿元投向第五、六代芯片;国产 GPU「四小龙」全部进入资本市场。
  • 中科曙光 IBGDA 规模化落地:十万卡级集群验证完成,配合 scaleFabric 构建「算存传」三级紧耦合通道。
  • 外滩大会(9–12 日)聚焦「共创 AI 新经济」:会场共识是从「生成」走向「执行」,40 余家具身智能厂商集中亮相,演示重点从「能不能抓」转向跨物品、光照与材质的实时适应。
  • IIFAA 智能体可信身份工作组成立:50 余家机构参与,指向 agent 代表用户执行操作时的身份、授权与追责标准——agent 经济开始进入规则建设阶段。
  • 工信部就 89 项通信行业标准征求意见:含《面向车联网应用的算力网络安全指南》,算力网络与车联网的安全责任与接口规范在落地前被固定。
  • 蚂蚁双线开源:多模态 Ling-3.0-flash-VL 与灵波 LingBot-World 2.0 三款世界模型(最小 1.3B,消费级单卡可实时生成)。
  • 京东开源交互式视听世界模型 JoyAI-EchoWM:WBench Navigation 平均 81.7 分,同时开放更轻量的因果流式变体,代码与权重已公开。
  • 宇树开源人形机器人基座 UnifoLM-WLA-1.0:6B 参数、约 2500 小时真机数据、单模型覆盖 64 项任务,代码/模型/数据集同步开放。

社区热议与争议

  • OpenAI 数学争议仍在发酵,焦点转向「流程信任」:一条质疑「研究者为何难以信任 OpenAI 处理未发表数学成果」的长帖在 HN 获 800 余分讨论;另有技术博客指出发布稿包含 Lean 4 形式化证明,讨论形式化验证能否替代不透明的内部流程。争议已从「证明对不对」转为「优先权、署名与可复核性如何被制度约束」。
  • 「OpenAI 反复把允许训练开关打开」:该帖获 450+ 分,讨论集中在默认隐私设置与开关持久性;在数据授权进入监管与诉讼核心议题时,默认值的可核查性比单次声明更重要。
  • 编码 harness 横评与本地化路线:九种 harness 在同一台笔记本上的对比受到关注(97 分),与 System76 192GB 工作站(105 分)出现在同一批热帖中——社区正在把「本地跑智能体」当成可比较的产品选择,而不是极客玩具。
  • PyTorch 生态的另一面:JEP 544(提前编译)等非 AI 项目也进入同一批热榜,反映出开发者注意力的分配:AI 工具链尽管占据头条,语言与编译基础设施的长期价值仍被持续讨论。

今日观察

第一条主线:harness 与运行环境被平台化收编。 今天 OpenAI 一口气推出 Agents API(托管 harness + 九家沙箱选择 + 子 agent 编排)、GPT-Live-1(把语音级联压成单模型)、Data agent 与金融版 ChatGPT(把企业数据与权限接到模型侧)。四件事的共同点不是模型更强,而是把「用起来」所需的一切都变成 API。对开发者的现实含义是:自建 harness 的窗口正在关闭,差异化会集中到「工具、知识与工作流」这三件真正属于业务的事上;对框架厂商的坏消息则是,中间层的护城河被上游收走了一部分。

第二条主线:成本曲线成为竞争主战场。 Cognition 用一个中国开源底座(Kimi K3)把编码能力做到接近前沿而成本约为四分之一;TPU Ironwood 的第三方测算显示每百万 token 成本低于 B200/B300;DeepSeek 系「轻量反超旗舰」的模型继续占据下载榜首。当能力差距在几个月内被后训练抹平,单位任务成本与推理吞吐就成了唯一能沉淀为客户价值的差异——这也是为什么今天最值得记住的数字不是任何 benchmark 分数,而是「0.181 美元/百万 token」和「64% 更便宜」。

第三条主线:安全叙事从「可能被滥用」变成「已经在执行」。 Anthropic 的报告描述的是能监测自己是否被检测、并据此重写恶意代码的智能体;本周的论文里,AgentHijack 展示了对计算机操作智能体的视觉补丁攻击,320B MoE 被单方向攻击的研究质疑前沿规模下的对齐稳健性。与之对应的制度建设(IIFAA 智能体身份工作组、推理期治理的可行性研究、AgentAudit 类审计框架)都在同一时间窗出现——能力、攻击面与治理工具正在同步长出,谁先跑完这一轮,谁就定义下一个阶段的默认规则。

第四条主线:中国的开源与资本同时加速。 燧原上市、IBGDA 在十万卡集群验证、蚂蚁/京东/宇树在同一天释放可下载的世界模型与具身基座,构成「资本 → 算力 → 开源资产」的完整链条。值得注意的是,这批开源件的共同技术关键词是「闭环」:视觉反馈、区域预测、交互控制——开源的方向正在从「给权重」转为「给闭环方法与数据资产」。

发布节奏观察:今天没有任何一家发布新的旗舰模型,但 API 侧的能力边界被显著推开(语音、数据、沙箱、政府许可)。这意味着竞争的节奏正在从「模型发布日」转为「可用性与定价的持续调整日」,对依赖稳定接口的工程团队来说,跟踪变更日志与退役时间表比跟踪发布会更重要。

风险提示:本日多条信息来自厂商自述或第三方单点分析(Anthropic 的滥用归因与蒸馏指控、Cognition 的自家 benchmark、TPU 成本测算、SpaceX 的合同披露),涉及主体、规模与效果的事项请以官方原文与后续独立复核为准。