AI 早报 2026-09-21

1、通义千问开源图像生成编辑一体化模型 Qwen-Image-2.1;2、阶跃星辰 Step 5 Preview 旗舰 MoE 模型全量开放 API;3、腾讯开源端到端文档解析模型 WeVisDoc;4、硅基流动完成大额系列股权融资,年内累计融资近 29 亿元;5、智谱 MaaS 平台即将上线数据不留存隐私能力;6、Google 开源 Agent 编排框架 AX

Dieses Briefing erscheint auf Chinesisch.

1、通义千问开源图像生成编辑一体化模型 Qwen-Image-2.1;

2、阶跃星辰 Step 5 Preview 旗舰 MoE 模型全量开放 API;

3、腾讯开源端到端文档解析模型 WeVisDoc;

4、硅基流动完成大额系列股权融资,年内累计融资近 29 亿元;

5、智谱 MaaS 平台即将上线数据不留存隐私能力;

6、Google 开源 Agent 编排框架 AX。

一、模型发布与开源

1. Qwen 开源图形生成与编辑模型 Qwen-Image-2.1

通义千问正式发布并开源 Qwen-Image-2.1,将文生图、图像编辑能力整合至单一模型,视觉生成模块为 7B 参数,采用 32 层 Single-Stream DiT 架构。模型原生支持 RGBA 透明图生成与图层提取,单次任务最多支持 10 张参考图输入,提供圈选、涂抹、独立掩码等精细化局部编辑功能。 模型重点强化人像身份保真、商品纹理一致性、文字排版、光影细节,支持全景图、信息图、分镜图生成。推理层面通过混合粒度注意力、KV Cache 复用降低多图输入算力开销;发布当日 Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 生态已完成适配。

2. 阶跃星辰发布 Step 5 Preview,现已全量开放

阶跃星辰推出面向 Agent 真实任务场景的旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B,激活参数 27B,支持百万 Token 超长上下文,兼容文本 + 多模态视觉输入,适配 AI 编程、软件工程、专业知识检索、金融分析等复杂 Agent 任务。 该模型在 Artificial Analysis Intelligence Index 评测取得 44 分,位列全球开源模型前三,官方宣称单任务调用成本仅为 Claude Opus 5 的 1/8。当前 API、Step Plan 订阅服务、在线 Studio 已全量开放体验;模型权重计划于 10 月 15 日对外释放。

3. 腾讯开源端到端文档解析模型 WeVisDoc

腾讯在 GitHub 与 Hugging Face 开源端到端文档解析模型 WeVisDoc,提供 2B、4B 两个版本,基于 Qwen3-VL 系列模型微调。模型可直接将图片版式文档转化为结构化 Markdown,完整保留原文阅读顺序、普通文本、LaTeX 公式、HTML 表格。 官方测试数据显示,WeVisDoc-4B 在 OmniDocBench v1.6、PureDocBench 四项测试集(Clean、Digital Degraded、Real Degraded)中,性能优于同期同类端到端文档解析模型。项目同步开放权重、完整代码与教程。

二、开发生态与工具更新

1. TypeSafe AI 开放 Jev 模型调用,新用户赠送 5 美元 Token 额度

TypeSafe AI 取消候补准入限制,向所有用户开放 Jev 模型调用能力。新注册用户自动获得 5 美元免费额度,官方估算该额度可支持约 1.2 亿 Token 调用量,开发者可直接登录在线控制台进行调试。

2. Google 开源 Agentic 编排器 AX,支持有状态任务暂停恢复

Google 在 GitHub 开源 Agent 工作负载编排工具 AX,可在 Kubernetes 集群上声明式管理有状态 Agent 任务。项目依托 Agent Substrate 实现任务沙箱隔离,支持任务暂停、恢复、在线调试,可统一管控运行环境、资源配额、网络策略与模型接入。 项目定位面向需要长期状态积累、强安全隔离的 Agent 业务,长期目标支持单集群承载数十亿任务。代码采用 Apache License 2.0 协议;项目尚处于早期迭代,稳定版前会存在破坏性接口变更,开发者可部署 CLI 与控制平面进行测试。

三、产品应用落地

本期 24 小时窗口暂无新增产品落地资讯

四、技术洞察与前沿研究

WebCraftBench:基于真实网页交互 + 代码覆盖率评估 AI 网页应用

腾讯混元联合清华、北大研究团队提出 WebCraftBench 评测基准,解决传统网页模型评测仅依靠静态截图、代码文本校验,无法验证功能可用性的痛点。该评测方案让 AI Agent 真实操作网页,结合代码覆盖率做功能校验,从美观度、易用性、需求匹配度多维打分。 数据集包含 369 条真实用户需求,5088 项验收标准,覆盖 17 个模型产出的 6273 套网页应用。在有效样本对照中,评测结果与人工复核偏好一致性达 85.3%。

五、行业动态与企业动作

1. 硅基流动完成 B + 轮二期及 C 轮融资,年内累计融资近 29 亿元

硅基流动官宣完成 B + 轮二期、C 轮两轮融资,2026 全年累计股权融资规模接近 29 亿元。投资方包含中国互联网投资基金、国新基金、中国移动链长基金,多家老股东持续加码。 本轮资金将投入推理引擎研发、异构算力调度优化、模型与芯片适配工程;同时持续迭代 Token 供应平台,加速海外市场业务拓展。

2. 智谱 MaaS 平台即将上线数据内容不留存功能

智谱 MaaS 平台新增隐私保护能力:数据不留存功能,企业 / 开发者用户可在 MaaS 控制台提交申请开通。功能生效后,用户输入、模型输出不会做静态持久化存储,数据仅用于单次模型调用。 该功能存在边界限制:Batch API、File API 等依赖持久化文件任务不在覆盖范围;出于法律法规、违规行为审计需要,平台在特定场景仍可留存数据 30 天及以上。具体生效时间、适用范围以平台审核结果为准。

六、前瞻与市场传闻

本期 24 小时窗口无经过初步核验的行业前瞻与市场传闻资讯

七、Claw 专题动态

本期 24 小时窗口暂无 Claw 专题相关动态更新

八、GitHub 热门开源项目

1. google/ax(Google Agentic )

Apache 2.0 协议,Kubernetes 上声明式编排有状态 Agent 任务,支持沙箱隔离、任务暂停、恢复调试,目标单集群可承载数十亿 Agent 任务。项目尚在迭代,稳定版前接口存在破坏性变更,适合大规模部署自主智能体的团队评估,也是本期开发生态重点项目。

2. NousResearch/hermes-agent

Python 开发,自我进化型 AI Agent,内置持续学习循环,可基于历史任务自动生成、优化技能,支持跨会话持久记忆、多模型切换、多消息平台接入。近 24 小时持续涨星,主打长期任务执行,适合个人助手、自动化工作流场景。

3. addyosmani/agent-skills

生产级 AI 编码 Agent 技能库,封装软件工程标准化能力集,提供需求拆解、代码审查、单元测试、项目重构等可复用 skill,适配 Cursor、Claude Code、OpenClaw 等主流编码 Agent,近期社区热度持续走高。

4. zai-org/zcode(智谱 ZCode)

智谱 AI 编程助手 ZCode 完成开源,官方已完成安全整改,移除本地仓库快照上传链路,代码交由社区审计监督;项目承诺用户代码数据零留存,不用于模型训练。适合开发者本地代码库智能编码、代码问答场景。

5. deepseek-ai/deepseek-harness

DeepSeek 官方 Agent 框架,采用 “一切皆插件” 架构,模型适配器、工具调用、会话日志、Agent 推理循环全部可插拔替换,配套开箱即用 WebUI,快速搭建多工具智能体,是国内开发者搭建 Agent 系统热门底座。

Alle Briefings

Entdecke weiter, was KI kannAlle Tools durchsuchen