阿里开源Qwen-Image-2.1:7B视觉生成模型原生支持RGBA透明图,4090可跑

AI快讯 2026-09-21

阿里通义千问团队于9月20日正式开源图像生成与编辑一体化模型Qwen-Image-2.1。该模型的视觉生成部分仅7B参数,原生支持2K分辨率输出和RGBA透明图像生成,并首次将文生图、透明图生成与多图编辑能力整合到同一模型中。开源当天即获得Diffusers、ComfyUI、vLLM-Omni、SGLang等主流推理框架的Day 0支持。

一、核心突破:原生透明图生成,省去抠图步骤

透明图像生成是本次更新最受关注的能力。模型能够根据提示词自动判断输出普通RGB图像还是带Alpha通道的RGBA图像,无需单独的抠图步骤。用户还可以输入真实照片,由模型自动提取主体并输出透明图层,在保留透明背景的前提下修改主体表情或编辑图层中的文字

这一能力直接改变了传统设计工作流。过去设计师需要“AI生图→PS抠图→手动修补→合成背景”多步操作,现在可以从生成环节直接获得透明背景素材,用于海报合成、电商主图、贴纸制作等场景。

image

二、模型架构:7B视觉生成 + 8B文本编码器

需要澄清一个容易误解的点:Qwen-Image-2.1的视觉生成部分是7B参数(32层Single-Stream DiT),但整条推理管线还包含一个Qwen3-VL 8B文本编码器,合计约16.22B参数。文生图的核心生成能力由7B模块承担,文本理解则由8B编码器完成。

效率方面,模型采用两项关键设计

  • 混合粒度注意力:文本部分使用token级因果掩码,图像生成部分使用chunk级掩码,让不同模态以不同粒度分配注意力;

  • 前缀KV Cache复用:将参考图和编辑指令等静态上下文在第一步预计算并缓存,后续去噪步骤直接复用,在多图输入场景下收益更为明显。

三、评测表现:Qwen-Image-Bench登顶开源第一

在千问团队自建的Qwen-Image-Bench评测中,Qwen-Image-2.1以60.28总分登顶开源模型第一,超过闭源的Nano Banana 2.0(59.82)和GPT Image 1.5(59.65)。上一代Qwen-Image 1.0得分为49.23

但需要理性看待这一成绩:Qwen-Image-Bench由千问团队自建并公开,三个模型的分差不足1分。它说明7B规模的开源模型已进入与顶级闭源产品同一梯队,但不等于在所有任务上全面领先。第三方独立评测尚在跟进中。

image

四、图像编辑能力:最多10张参考图,多区域独立编辑

Qwen-Image-2.1支持最多10张参考图输入,可综合多个主体与素材生成协调画面。局部编辑支持圈选、涂抹和独立掩码三种方式,一次可指定多个区域分别修改。模型重点提升了人像与商品的一致性——修图后人物面部特征、商品文字与形态均能保持高度还原

五、许可证变更:研究许可,商用需单独申请

Qwen-Image-2.1采用《Qwen Research License Agreement》,授予的权利“仅限非商业用途”,商业使用需要向厂商另行申请许可。这与早期Qwen-Image系列以Apache 2.0发布的情况不同。

对个人用户和研究者而言,这一许可允许阅读、评估、基准测试和非商业使用,不影响日常体验和学术探索。但企业若计划将模型部署到付费产品或商业流程中,需要提前申请商业授权

六、硬件门槛与实测体验

Qwen-Image-2.1的一个突出优势是硬件门槛低。官方展示的最低配置为RTX 3090级别(24GB显存)。开源当天,Diffusers、ComfyUI、vLLM-Omni、SGLang等框架均已完成适配。ComfyUI官方提供了文生图和图像编辑两套示例工作流,用户可以直接加载使用。

需要注意的是,实际显存占用与分辨率、精度和输入图数量相关。有报道提到2K推理可能需要56 GiB显存(取决于配置),建议用户根据自身硬件条件调整分辨率。

从公开实测反馈来看,Qwen-Image-2.1在电商产品图、透明素材生成等场景中表现突出。一个香水瓶的透明背景可以直接用于海报合成,边缘无白边和锯齿,省去了remove.bg等后处理工具的步骤。但在追求电影质感或艺术氛围的场景中,它与Midjourney等以美学见长的模型仍有差距,更适合功能性图像生产而非艺术创作。

在指令遵循方面,部分Reddit用户反馈并非100%完美——复杂的空间关系描述(如“左边红色杯子、右边蓝色花瓶”)可能出现颜色或位置偏移,需要借助括号权重来强调。这一点与GPT Image等闭源模型相比仍有提升空间。

七、行业意义

Qwen-Image-2.1的发布传递了一个明确信号:图像生成模型的竞争正在从“参数规模竞赛”转向“效率与功能整合”。7B视觉生成模块跑在消费级显卡上,意味着AI图像生成能力不再是大公司实验室的专属。将透明图生成、多图编辑、2K输出整合到单一模型中,也降低了开发者和创作者的工具链复杂度。

随着模型小到能在消费级硬件上运行,AI图像生成正在从“尝鲜工具”向“生产力工具”转变。

八、常见问题FAQ

Qwen-Image-2.1的7B参数指的是什么?

指视觉生成模块的参数(32层Single-Stream DiT)。整条管线还包含一个8B的Qwen3-VL文本编码器,合计约16.22B参数。

它真的能跑在4090上吗?

官方最低配置为RTX 3090级别(24GB显存)。实际运行效果取决于分辨率、精度和输入图数量。2K分辨率下可能需要更高显存,建议根据硬件条件调整。

可以商用吗?

当前采用研究许可,仅限非商业用途。企业商用需要向千问团队单独申请商业授权。

和上一代Qwen-Image 1.0相比有什么提升?

核心提升包括:原生RGBA透明图生成、参考图上限从1张提升到10张、局部编辑支持圈选/涂抹/独立掩码三种方式、Qwen-Image-Bench得分从49.23提升到60.28。

在哪里下载?

已在GitHub、Hugging Face和ModelScope同步开源。ComfyUI官方提供了兼容权重和示例工作流。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具集原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

相关文章

评论