返回资讯列表

Qwen 开源 Qwen-Image-2.1:7B 模型统一生成、编辑与透明图像

Qwen 表示,Qwen-Image-2.1 将文生图、图像编辑和透明图像处理整合到一个 7B 视觉生成组件中,支持最多 10 张参考图及多种局部编辑方式,面向设计、内容创作、电商和视觉叙事等场景。

AiPix2026年9月21日

Qwen 开源了 Qwen-Image-2.1,将文生图与图像编辑统一到单一模型中。根据 Qwen 官方博客,该模型的视觉生成组件包含 32 层单流 DiT 和 7B 参数,并原生支持普通图像与透明图像的生成和编辑。

透明度是此次更新的重点。Qwen 表示,用户可以通过提示词选择输出普通图像或带透明度通道的图像,也可以在保留透明背景的情况下修改主体表情、编辑透明图层中的文字,或从 RGB 照片中提取主体,生成可复用于设计和合成工作的 RGBA 图层。Qwen 还说明,Qwen-Image-2.1 将此前于 2025 年 12 月推出的 Qwen-Image-Layered 的透明图像能力整合进了统一模型。

编辑方面,模型最多支持 10 张参考图像,可将人物、服装、鞋子、包、帽子或家具等多个素材组合到同一构图中。局部编辑则支持圆形标注、手绘标注和独立掩码。独立掩码可以在不遮挡原始图像内容的情况下指定编辑区域,适合需要保留完整输入的工作流。Qwen 同时强调,模型改进了人像身份和产品一致性,目标是更好保留面部特征,以及产品的文字、纹理和形状。

在推理效率方面,Qwen 介绍了混合粒度注意力架构:文本使用 token 级因果掩码,图像生成使用块级掩码;通过 KV cache 复用,输入图像和编辑指令可以作为静态上下文在第一步计算并缓存,从而提升推理效率并降低内存占用。这里的效果属于 Qwen 官方介绍,本文未进行独立测试。

任务覆盖范围还包括全景图、信息图和分镜图生成,同时更新了文字渲染、人像光照与细节表现。对视觉创作者而言,统一生成、透明素材提取、多参考合成和局部修改,意味着同一模型可以连接概念探索、素材准备与后续编辑。实际是否适合具体项目,仍需结合部署条件、输出稳定性和工作流要求评估。

来源

  1. Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像Qwen:Blog Retrieval(API)

在 AiPix 中继续

把资讯中的能力转化为实际的图片或画布工作流。

打开 AI 画布