2026 年 7 月 21 日,通义千问团队宣布推出第三代基础图像生成模型 Qwen-Image-3.0。如果说前两代产品是在追求“画得准”和“画得美”,那么 3.0 版本的核心进化则可以用一个字概括——“实”。这标志着 AI 绘图正式从实验室的“艺术创作”迈向了办公桌上的“生产力工具”。

核心突破:超长指令与复杂布局的完美驾驭
Qwen-Image-3.0 最显著的提升在于对 Rich Content(丰富内容) 的支持,让复杂创意的精准呈现成为可能:
- 4.5k Token 超长输入:模型现在能听懂更长、更复杂的指令。在官方演示中,它能在一张图里同时生成包含 9 个不同学科领域的复杂信息图,且每个区域的逻辑和细节互不干扰。
- 空间控制与语义嵌套:它不仅能横向平铺元素,还能实现纵向的“画中画”嵌套。例如,在一张图中精准还原从 VSCode 代码界面到手机微信聊天框的多层 UI 嵌套,这种逻辑拆解能力简直是 UI/UX 设计师的福音。
细节狂魔:10px 微缩文字也能清晰可见
在 Authentic Details(真实细节) 维度上,Qwen-Image-3.0 展现出了令人惊叹的微观表现力。它支持低至 10px 的微缩文字渲染,这意味着 AI 生成的报纸、学术论文甚至复杂的数学公式不再是“乱码堆砌”,而是具备了实际的阅读价值。
除了文字,模型在质感写实上也达到了新高度。无论是人像摄影中的毛孔与发丝,还是报纸的纸张纹理,甚至是模拟学生笔记中的红色手写批注,其还原度都极高。对于需要修复文物或古画的用户,它还能在保持原有笔触和墨色渲染的情况下,实现完美的“修旧如旧”。
深厚积淀:多语言支持与实时知识联动
Deep Knowledge(深厚知识) 让 Qwen-Image-3.0 变得更加博学。它原生支持 12 种语言 的渲染,并内置了 100 多种艺术风格和各类主流 UI 界面知识。
更具实用价值的是,该模型具备了 实时联网能力。你可以要求它生成一份“今日杭州天气预报图”,或者让齐白石和梵高在直播间里同框带货。这种将模型预训练知识与实时互联网信息相结合的能力,极大拓展了内容创作的边界。
从“好看”到“好用”的跨越
通义团队表示,Qwen-Image-3.0 的目标是让图像生成从“欣赏”变为“应用”。无论是在短剧分镜脚本的快速产出、复杂界面的原型设计,还是教育领域的专业图表制作,这款模型都表现出了极强的落地能力。随着 AI 理解力的提升,高质量的图像创作将变得更加触手可及,不再受限于复杂的绘图技巧。