Qwen3.8-Omni-Flash 发布:音视频智能体从理解走向交付
Qwen 官方发布 Qwen3.8-Omni-Flash,强调文本、图像、音频和视频输入、1M token 上下文窗口,以及面向音视频智能体的任务规划、工具调用和交付能力。对视觉创作者而言,重点不只是模型能看懂素材,而是音视频工作流可能被进一步自动化。
来源事实
Qwen 在官方博客发布 Qwen3.8-Omni-Flash,称其为下一代原生全模态模型,目标是让智能体从“理解全模态内容”走向“规划任务、调用工具并完成创作工作”。官方称,该模型支持文本、图像、音频和视频输入,具备 1M token 上下文窗口,并已在 Qianwen AI Platform 可用。
按 Qwen 说明,Qwen3.8-Omni-Flash 在 29 项评测中的平均得分较 Qwen3.5-Omni-Plus 提升超过 25%;每小时音频输入 API 价格下降超过 98%,每小时音视频输入价格下降超过 93%。在音视频智能体、编程和长时程任务方面,官方列出 WildClawBench-MM 提升 36.5 分、AgenticVBench 提升 22.3 分,并称 UniClawBench 得分为 69.6。Qwen 还表示,该模型在 LongAudioSpan 上提升 8.3 分,在 OmniVideoBench 上提升 9.6 分,OmniCap-IF 的 CSR 和 ISR 分别提升 8.5 分和 14.1 分,AliMeeting 的 DER 和 cpWER 从 88.11 / 89.61 降至 3.35 / 17.18。
围绕音视频生产力,Qwen 同时提到 Qwen-MM-Plugins 和 Qwen-Live Harness。前者扩展了面向长音频、长视频的按需感知、工具调用与工作流执行能力,并包含 Video2Note、Omni Skill Creator 等开源能力;后者被描述为面向持续、实时全模态交互的原生运行时。官方示例覆盖可控音视频描述、长视频证据收集、会议纪要与行动项、Music2MV、短剧翻译、长片影评解说,以及通过 Qwen3.8-Omni-Flash-Realtime 实现实时口语练习、空间音频感知和外部知识注入。
AiPix 分析
对视觉创作者来说,这次发布的关键信号是:音视频模型正在从“素材理解工具”转向“创作流程协调者”。如果官方描述的工具调用、长上下文和实时交互能力在实际产品中稳定落地,创作者未来处理长视频、会议素材、教程内容和多语言短剧时,可能更少依赖手动在转录、翻译、剪辑、配音和审核工具之间切换。
但应注意,以上性能、价格和工作流能力均来自 Qwen 官方信息,并非 AiPix 实测。对创作团队而言,更务实的评估方式不是只看单项榜单,而是把它放进真实流程:例如一小时会议能否稳定产出可用纪要,教程视频能否转成结构化笔记,短剧翻译能否保持角色声线、时长和画面节奏一致。对于 AiPix 这类以 AI Canvas 为核心的图像和视频创作平台,这类全模态智能体趋势也说明,未来创作入口会更接近“一句话提出目标,系统理解素材并组织交付”的路径。
来源
- Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付Qwen:Blog Retrieval(API)
在 AiPix 中继续
把资讯中的能力转化为实际的图片或画布工作流。
打开 AI 画布