AI 行业日报 | 2026 - 09 - 20

1、DeepSeek 更新 API 峰谷计费策略,调休周末、法定节假日统一按空闲时段计价;2、阶跃星辰 Step 5 Preview 登上 Artificial Analysis 评测榜单,支持百万上下文 + 视觉能力;3、国内多家机构集中开源模型,达摩院腹部 CT 医疗大模型 RADAR 登上《Science》,中国电信开源 Xing4.0-29B-A4B 国产算力 MoE 模型,千问发布 60 语种实时同传模型 Qwen3.8-LiveTranslate;4、OpenAI、Anthropic、Google、SpaceXAI 四家企业遭付费用户集体反垄断诉讼;5、行业传出多家头部厂商下一代模型爆料,包含 GPT-6 Sol/Luna、Gemini 4 Pro、MiniMax M3.1、Kimi K3.1 等

Denne oppsummeringen publiseres på kinesisk.

1、DeepSeek 更新 API 峰谷计费策略,调休周末、法定节假日统一按空闲时段计价;

2、阶跃星辰 Step 5 Preview 登上 Artificial Analysis 评测榜单,支持百万上下文 + 视觉能力;

3、国内多家机构集中开源模型,达摩院腹部 CT 医疗大模型 RADAR 登上《Science》,中国电信开源 Xing4.0-29B-A4B 国产算力 MoE 模型,千问发布 60 语种实时同传模型 Qwen3.8-LiveTranslate;

4、OpenAI、Anthropic、Google、SpaceXAI 四家企业遭付费用户集体反垄断诉讼;

5、行业传出多家头部厂商下一代模型爆料,包含 GPT-6 Sol/Luna、Gemini 4 Pro、MiniMax M3.1、Kimi K3.1 等。

一、模型发布与开源

1. 阶跃星辰 Step 5 Preview 现身 Artificial Analysis 评测榜单,部分用户开放内测

Artificial Analysis 平台收录 Step 5 Preview 并完成独立第三方评测,部分 Step Plan 订阅用户已可调用该模型。榜单信息显示模型智能指数 44,支持 1M 上下文窗口与视觉输入;定价为百万输入 Token 1 美元,百万输出 Token 2.7 美元。当前标记为闭源模型,阶跃星辰暂未举办官方正式发布会,模型完整能力、全面上线时间待定。

2. 阿里通义千问发布 Qwen3.8-LiveTranslate 实时同传模型

千问正式推出 Qwen3.8-LiveTranslate 同声传译大模型,支持 60 种语言实时翻译。模型采用 Interleave 交织架构与 Thinker-Talker 双模块设计,复用音频缓存,将字均延迟由上一代 2.8s 降至 2.3s;新增实时说话人分离、原文译文同帧输出、长上下文消歧三大核心能力。多说话人长音频、多语言同传评测结果优于前代与市面主流同传系统,现已开放在线体验与 API 调用。

3. 达摩院腹部 CT 诊断模型 RADAR 开源,论文登上 Science 期刊

阿里巴巴达摩院开源腹部 CT 医疗多模态模型 RADAR(Rapid Abdominal Diagnosis with AI and Radiology),相关研究论文发表于《Science》。模型在 424911 例增强腹部 CT、1500 万解剖级图文对数据集训练,无需人工标注;覆盖 18 个解剖结构、146 项影像病灶发现。真实临床队列 AUC 达 0.913,8 家外部医院 AUC 区间 0.874~0.912;放射医师联合 RADAR 阅片,诊断敏感度提升约 10%。权重、代码、训练文档全部开源,Apache2.0 协议。

GitHub 仓库:https://github.com/alibaba-damo-academy/damo-radar HuggingFace 权重:https://huggingface.co/radar-generalist/RADAR 论文地址:https://www.science.org/doi/10.1126/science.aec6129

4. Cua 开源轻量表单填写专用模型 cua-s1-forms

Cua 开源面向 GUI 自动化表单填写的专用小模型 cua-s1-forms,总参数量约 70 万,模型权重文件仅 2.8MB,支持本地部署运行。模型单次前向推理,对页面表单元素输出填写、勾选、点击、跳过四类操作评分,交由 Cua Driver 执行自动化流程。合成数据集测试准确率 99.95%,小规模真实演示集评估准确率 100%;项目处于早期研究原型,不属于通用大模型,未经过大规模真实生产表单验证。

HuggingFace:https://huggingface.co/cua-ai/cua-s1-forms GitHub 仓库:https://github.com/trycua/cua/tree/main/libs/cua-s1

5. 中国电信开源星辰 Xing4.0-29B-A4B MoE 大模型

中国电信旗下中电信人工智能开源星辰语义大模型 Xing4.0-29B-A4B,总参数 29B,激活参数 4B。模型面向工程任务、Agent 智能体场景优化,采用 mHC、MLA、MTP 架构,原生支持 256K 上下文,可扩展至 512K;完整基于昇腾 910C 国产算力集群训练,基于 MindSpore、MindFormers 深度适配,训练吞吐较原生基线提升约 96%。同步放出基础版、FP8 量化版、GGUF 版,可在 HuggingFace、ModelScope 获取,支持本地推理、微调与服务化部署。

GitHub 仓库:https://github.com/XingChen-AGI/Xing4.0-29B-A4B HuggingFace:https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B

二、开发生态与工具更新

1. DeepSeek API 更新峰谷计费规则,调休周末、法定节假日全部按空闲时段计费

DeepSeek 平台发布计费公告,明确计费时段判定逻辑:中国法定节假日、调休上班的周末,全天统一按空闲时段计费。即使周末因调休需要上班,不切换至高峰计价,该规则适用于全部 DeepSeek 官方 API 调用用户。开发者可依托该规则规划批量推理、离线任务,降低节假日算力成本。

DeepSeek 开放平台:https://platform.deepseek.com/

2. Android Developers 发布 Android Bench 2.0 评测基准

谷歌 Android 团队推出 Android Bench 2.0,面向 AI Agent + 模型组合开展工程能力评测。评测任务覆盖完整真实 Android 开发工作流:从零新建 App、迭代新增功能、跨平台代码迁移。从任务完成率、UI 视觉保真、回归 bug、调用成本多维度打分。新版纳入多款主流模型:Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-6 Astra、Fable 5.1、Kimi K3、Qwen3.8 Max。评测方法、对比结果已公开。

官方文档:https://developer.android.com/bench 官方 X 动态:https://x.com/AndroidDev/status/2100622197253398669

3. OpenAI Codex 负责人 Tibo 回应社区 banked reset 诉求

社区用户因本周未等到预期 Codex 更新,向 Codex 负责人 Tibo 请求 banked reset。Tibo 回复原文:“OK fine. But it’s also still coming in Tuesday”。社区出现两种解读:一部分开发者认为代表同意发放 reset;另一观点指出回复没有明确确认 reset,唯一确定信息是预告功能将于周二上线,banked reset 是否生效仍无官方定论。

X 原帖:https://x.com/thsottiaux/status/2101352781219258527

三、产品应用落地

本期无新增独立产品落地资讯

四、技术洞察与前沿研究

1. 医疗多模态模型进入临床辅助阅片阶段,RADAR 证明 AI 可提升放射医生检出率

达摩院 RADAR 研究成果验证,基于大规模临床 CT 报告训练的视觉语言模型,不需要精细人工病灶标注,即可完成腹部多器官影像筛查。在人机协同阅片模式下,模型辅助放射科医生,整体诊断敏感度提升约 10%。提示医疗 AI 下一阶段重点不再是单纯跑分,而是人机协同临床工作流适配;但真实世界多中心差异、医疗合规、设备异构仍是规模化落地障碍。

2. 轻量专用 GUI 模型路线兴起,小参数模型解决垂直自动化任务

cua-s1-forms 仅 70 万参数即可完成表单元素识别与操作决策,代表一类新范式:不依赖通用大模型做 GUI 自动化,使用极小参数专用模型做界面元素动作打分。优势是本地低延迟、低成本;局限是泛化能力弱,仅适配训练分布内表单,很难直接迁移到互联网海量异构页面。该方向适合企业内网标准化表单自动化场景。

3. Agent 评测标准转向完整工程任务,Android Bench 2.0 提供新参考范式

传统 LLM 评测集中在单轮问答、代码片段生成,Android Bench 2.0 将评测升级为跨多日、多步骤完整工程项目,同时评估 Agent + 基座模型组合。这类评测更贴近企业真实采购的价值判断,未来企业选型会逐步减少只看榜单分数,优先看端到端复杂任务完成能力。

五、行业动态与企业动作

1. OpenAI、Anthropic、Google、SpaceXAI 四家企业遭付费用户集体反垄断诉讼

付费订阅用户于加州北区联邦法院提起集体诉讼,被告包含 OpenAI、Anthropic、SpaceXAI、Google。原告指控四家公司高管公开发文呼吁协调控制 AI 发展速度,属于合谋限制产品迭代,违反谢尔曼反垄断法;用户付出订阅费用,但产品性能提升速度人为放缓。原告申请集体诉讼认证、禁令及违法判决;四家企业暂未对外回应。

六、前瞻与市场传闻

本板块内容均为行业爆料、社区猜测,无官方确认,仅作行业参考,不构成投资与采购决策依据

1. Anthropic 拟推出新版模型,应对 GPT-6 Astra 企业市场冲击

路透社援引 3 名知情人士消息:Anthropic 考虑发布新一代模型,对冲 Astra 在企业客户市场的增长势头;目前模型安全评估工作仍在推进,尚未确定发布时间与版本。社区爆料博主称新版 Fable、Opus、Sonnet 正在少量账号隐蔽灰度测试;同时 Anthropic 需要平衡模型研发投入、盈利目标,为后续 IPO 铺路。

2. OpenAI 下周或发布 GPT-6 Sol、GPT-6 Luna,DevDay 9 月 29 日举办

OpenAI 团队 Tibo 与 Sam Altman 对外释放信号,原计划内容推迟至下周优先发布,剩余内容将在 DevDay 持续释放;Tibo 称储备内容体量足够举办 3 场开发者大会。社区用户提问希望上线 GPT-6 Sol、GPT-6 Luna,Tibo 回复 “What else do you want”,被市场解读为两款模型为候选发布对象。OpenAI DevDay 当地时间 9 月 29 日召开。

X 原帖:https://x.com/thsottiaux/status/2101157729037586694

3. 传闻 Google Gemini 4 Pro 正在 Arena 隐藏灰度测试

多名第三方测试者反馈,在 Gemini Arena 平台,调用 gemini-3.8-flash 会随机路由到代号 Argon 的 Gemini 4 Pro 内部检查点,SVG 绘制、3D 场景、网页与游戏生成能力提升明显。网传一张基准图经鉴别是 GPT-Image 生成,不具备参考效力;Google 暂未确认 Gemini4 Pro 型号、参数、定价及上线时间。

X 爆料:https://x.com/god_of_ai7/status/2101237972633063922

4. MiniMax-M3.1 线索在开源 CLI 代码中被发现

社区检索 MiniMax 开源 MiniMax Code CLI 仓库代码,多个配置文件出现 MiniMax-M3.1 标识,配置包含 450K/512K/1M 多档上下文窗口,多组输出长度与 thinking effort 推理档位。社区截图显示内部人员预告模型即将发布,当前模型尚未内置上线,完整能力未知。

GitHub 检索地址:https://github.com/search?q=repo%3AMiniMax-AI%2Fminimax-code+minimax-m3.1&type=code

5. 月之暗面 Kimi K3.1 传出预热线索,官方动态已删除

Kimi 知乎认证机构账号发布一串圆周率数字,起始片段缺少 “3.1”,被行业解读为暗示 Kimi K3.1 新版本。该帖没有直接提及模型版本、参数、上线时间,目前这条知乎动态已经删除,暂无任何官方确认信息。

七、Claw 专题动态

1. 算力定价精细化持续演进,峰谷计费成为 API 厂商差异化抓手

DeepSeek 本次调整峰谷计费逻辑,把调休、节假日统一划入低价空闲时段,本质是国内云 API 厂商精细化运营的体现。企业客户可以把批量推理、离线 RAG、模型评估等非实时任务调度至空闲时段,显著降本;后续其他国内大模型 API 厂商大概率跟进细化时段规则,算力成本调度会成为 AI 工程团队必备能力。

2. 医疗多模态模型迎来学术突破,但商业化落地仍有强监管门槛

达摩院 RADAR 登上 Science,证明国产医疗大模型在影像辅助诊断领域达到国际顶尖水平。但医疗 AI 不能仅靠论文开源完成落地,医疗器械资质、院内数据合规、责任界定、多中心真实世界验证是核心卡点;开源权重更多用于科研、二次研究,直接接入临床诊断系统仍需严格合规审批。

3. 头部大模型厂商进入密集发布窗口期,企业市场竞争白热化

从多方传闻看,OpenAI、Anthropic、MiniMax、月之暗面、Google 都在准备下一代基座模型,集中瞄准企业 Agent、长上下文、复杂推理赛道。Astra 快速抢占企业 Token 份额倒逼竞品加速迭代;企业客户选型周期缩短,模型版本迭代速度会持续加快,采购策略要预留快速切换基座的弹性架构。

八、GitHub 热门开源项目

2026‑09‑20 当日 Trending AI

1. alibaba-damo-academy/damo-radar

热度:医疗多模态模型,今日新增 Star 快速上涨 简介:达摩院发布腹部 CT 影像诊断模型 RADAR,Science 论文配套开源仓库,含数据处理、训练、推理全套代码,Apache2.0 协议,面向医学影像 AI 科研。

2. XingChen-AGI/Xing4.0-29B-A4B

热度:国产算力 MoE 模型,国内开发者关注度飙升 简介:中国电信开源星辰 Xing4.0-29B-A4B,昇腾集群训练,原生支持 256K 上下文,面向 Agent 工程任务,提供 FP8、GGUF 多量化版本。

3. trycua/cua

热度:GUI 智能体自动化项目,cua-s1-forms 配套主仓库 简介:计算机使用 Agent 框架,本次新增轻量表单填写专用小模型,支持本地运行页面元素识别、表单自动填写,适合内网自动化场景。

4. MiniMax-AI/minimax-code

热度:MiniMax 代码 CLI 工具,社区发现 M3.1 模型配置线索 简介:MiniMax 官方开源代码 Agent 命令行工具,用于代码读写、工程调研,仓库内代码文件出现下一代 M3.1 模型相关配置字段。

Alle oppsummeringer

Fortsett å utforske hva AI kan gjøreBla gjennom alle verktøy