三方对打 · 同机同卡同题面 · seed 42

Qwen-Image-2.1 到底行不行:公开榜单成绩 + 九个垂直领域的实测

Qwen-Image-2.1 对上 SenseNova-U1.5 与 4 步蒸馏的 FLUX.2-klein-KV,同一台机器、同一张卡、同一份题面。 公开榜单那轮暴露的差距主要是口径问题(官方要的是「提示词增强 + 2K/40 步」,我们首轮全没用), 而垂直领域这轮暴露的是分工问题:三家没有通吃的,各有各的活。

数据:公开题面 18 道 75 张图 + 自建垂直题面 26 道 156 张图(9 个领域)| 全部出图与日志在仓库里

01一眼看清

先给结论,细节在下面各节。数字都是本次抽样的实测值,不是榜单成绩。

GenEval 组合题(7 题)
4/7
Qwen 只过 4 题,两个对手 7/7。原题面是给自动打分器写的极简句式,恰好是它最不利的输入
中文长文本 · 逐行命中
18/20
Qwen 与 SenseNova 打平,FLUX 0/20。中文长文本是这两家的主场
垂直套件 · 文字题命中率
97.9%
SenseNova 1024² 档最高;Qwen 83.3%、FLUX 52.1%(8 道文字题)。看 UI 能力要看命中率
1024² 单张中位耗时
1.5–53.2 s
FLUX 1.5 s / SenseNova 9.8 s / Qwen 53.2 s,差 35 倍
垂直套件 1024² 档:文字题命中率(8 道)
SenseNova97.9%
Qwen83.3%
FLUX52.1%
18 道题的单张中位耗时(秒,越短越好)
FLUX 1536²3.8 s
Sense 1024²9.8 s
Sense 2048²13.2 s
Qwen 1024²53.2 s
Qwen 2048²113.1 s

02垂直领域:26 道自建题,9 个领域

题面是我们自己写的(prompts-vertical.json), 每题都写明考点与判定项。三家各跑两档分辨率:统一的 1024²(可横向比)+ 各家推荐分辨率(Qwen / SenseNova 2048²、FLUX 1536),共 156 张。

领域题数推荐关键发现
建筑·外景3三家都能用商业级氛围图都出得来。差别在细节:SenseNova 1024 与 FLUX 1536 会在玻璃幕墙上「幻觉」出大字号招牌ARCHITECTURE / NEAC),Qwen 没有这个毛病
建筑·室内3SenseNova空间与灯光层次最稳。Qwen 在 1024² 会丢掉氛围约束:夜景卧室题出成了白天
人像4SenseNova(特写)
三家都行(合影、全身)
老年人特写这种高频细节题差距最大:SenseNova 的皱纹、胡须、毛细血管是照片级的,Qwen 明显更平滑。五人合影三家都给了 5 张不同的脸,手指无可见崩坏
App·UI4SenseNova只有它在 1024² 就把中文界面写对(12/12 条命中)。Qwen 在 1024² 会把整张 mockup 缩成中间一小块并留幽灵重影,2048² 才恢复(命中 5/12 → 11/12)。FLUX 中文全错
商品·电商2三家都可用白底精修与场景图都能直接交付。Qwen 在 1024² 漏了「两只瓶子」,但标签文字它最准(100%)
游戏·图标2Qwen(单个图标)单个图标三家都能出商业级;「12 个风格一致的线性图标」三家全崩——数量、线宽、风格都不统一
动漫·二次元4Qwen / SenseNova番剧海报:两家的中文主标题、副标题、播出信息、制作署名全写对(OCR 4/4、字符 100%,Qwen 两档满分),FLUX 整行乱码(0/4)。角色立绘与双人雨夜场景三家都能出;Q版六格表情包三家都过了,与「12 个线性图标」那题形成对比
漫画·分镜2SenseNova四格漫画:只有 SenseNova 1024² 把四句中文台词放进对应画格(100% · 4/4);Qwen 四句都写出来了但配对搞乱、还夹乱码(字符准确率 34.8%);FLUX 全乱。黑白动作分镜页三家都能出「5 格 + 速度线 + 眼睛特写」
插画·绘本2SenseNova(水墨)/ 两家都行(绘本)绘本跨页:Qwen 两档都是 100%,SenseNova 也对,FLUX 乱码。国风水墨:SenseNova 的浓淡层次最好;Qwen 两档都「太淡」——留白过头,山体几乎看不见
建筑外景:3 家模型 × 2 档分辨率并排
建筑·外景 — 上排 1024²,下排各家推荐分辨率。注意右侧两张玻璃幕墙上的幻觉招牌
室内:3 家模型 × 2 档分辨率并排
建筑·室内 — SenseNova 的空间与灯光层次最稳
人像:3 家模型 × 2 档分辨率并排
人像 — 老年人特写的高频细节差距最大
App UI:3 家模型 × 2 档分辨率并排
App·UI — Qwen 1024² 缩成小块带重影,SenseNova 1024² 直接可用
商品:3 家模型 × 2 档分辨率并排
商品·电商 — 三家都能交付,看标签文字准确率
游戏图标:3 家模型 × 2 档分辨率并排
游戏·图标 — 单个能出,成套图标三家全崩
动漫:3 家模型 × 2 档分辨率并排
动漫·二次元 — 中文海报 Qwen / SenseNova 全对,FLUX 乱码;Q版六格三家都过
漫画分镜:3 家模型 × 2 档分辨率并排
漫画·分镜 — 只有 SenseNova 把台词放进对应画格
插画绘本:3 家模型 × 2 档分辨率并排
插画·绘本 — 绘本文字都对;水墨 Qwen 太淡

03带文字题目的客观打分(OCR)

RapidOCR 读出图里的文字,与题目要求文本逐字比对:字符准确率 = 1 − 编辑距离 / 参考长度;逐行命中 = 该行相似度 ≥ 0.85。与公开榜单那轮用的是同一把尺子。

题目档位Qwen-Image-2.1SenseNova-U1.5FLUX.2-klein-KV
ui-mobile-home-zh 中文健康 App 首页1024²63.0% · 5/1280.9% · 12/1238.0% · 2/12
原生86.4% · 11/1282.6% · 12/1233.0% · 2/12
ui-login-en 英文登录页1024²85.3% · 6/696.8% · 6/677.9% · 5/6
原生96.0% · 5/699.2% · 6/683.0% · 6/6
ui-dashboard-dark 深色数据看板1024²29.8% · 13/1413.3% · 13/1417.1% · 12/14
原生34.1% · 13/1424.4% · 13/1422.2% · 11/14
ui-appstore-three 三屏商店图1024²33.3% · 4/422.4% · 4/422.4% · 3/4
原生23.8% · 4/418.2% · 3/414.4% · 3/4
product-skincare-white 白底瓶身标签1024²100% · 3/366.7% · 3/372.1% · 3/3
原生66.7% · 3/366.7% · 3/3100% · 3/3
anime-keyvisual-zh 番剧海报(标题/副标题/播出/制作)1024²100% · 4/4100% · 4/457.8% · 0/4
原生100% · 4/498.0% · 4/455.8% · 0/4
comic-four-panel-zh 四格漫画的中文对白1024²34.8% · 4/4100% · 4/422.9% · 0/4
原生33.3% · 4/481.1% · 4/414.6% · 0/4
book-illust-spread 绘本跨页的一行正文1024²100% · 1/1100% · 1/121.1% · 0/1
原生100% · 1/190.9% · 1/113.3% · 0/1
平均(8 道文字题)1024²68.3% · 83.3%72.5% · 97.9%41.2% · 52.1%
原生67.5% · 93.8%70.1% · 95.8%42.0% · 52.1%

04选型矩阵:这个活该用谁

把上面两轮的结论压成一张表,直接照这个挑。

场景推荐理由
建筑效果图(要氛围与材质)SenseNova黄昏/夜景的光最准;但它会往玻璃幕墙上写幻觉招牌,出图后要过一眼
室内效果图SenseNova空间关系与灯光层次最稳
人像特写(要真实皮肤)SenseNova高频细节差距明显,Qwen 偏平滑
合影 / 全身三家都行比例正常、脸各不相同
App / 网页 UI 稿(含中文)SenseNova1024² 就能用,且比 Qwen 快 5.4 倍
App / 网页 UI 稿(纯英文)Qwen @2048²,或 SenseNovaQwen 的英文标注最干净,但 1024² 下会缩成小块留重影
商品白底图三家都行需求写清楚就够
游戏单图标Qwen造型与光效最立体
成套图标 / 严格一致的多元素都不行会退化成「一堆各画各的」,需要后处理或换专用模型
番剧 / 游戏宣传海报(含中文大标题)Qwen 或 SenseNova两家的中文标题层级都到位(OCR 4/4);FLUX 中文整行乱码
Q版表情包 / 贴纸组(6 格以内)SenseNova三家都能出,它的格子、白描边、表情差异最规整
四格漫画(带中文对白)SenseNova只有它把台词放进对应画格;Qwen 会串格,FLUX 全乱
黑白动作分镜页(无对白)三家都能出区别在分格是否规整:SenseNova > FLUX > Qwen
儿童绘本跨页(带一行正文)Qwen 或 SenseNova文字都对;Qwen 还会给出「翻开的书页」立体感
国风水墨山水SenseNova浓淡层次与点景最稳;Qwen 两档都太淡

05公开榜单那轮:差距主要不在模型,在口径

题面一字未改,取自 GenEval / DPG-Bench / LongText-Bench,同 seed。官方推荐管线是「提示词增强器 + 2K/40 步 + 长英文描述」,我们首轮用的是「原始短题面 + 1K/20 步」。

Qwen-Image-2.1SenseNova-U1.5FLUX.2-klein-KV
形态7B DiT(生成)+ Qwen3-VL 编码器,RGBA VAE8B+8B MoT,8 步 + LoRA9B 蒸馏 + INT4 KV,4 步
1024² 单张(中位)52.1 s(20 步)9.8 s1.6 s
2048² 单张102–111 s13 s不支持(≤1536)
文字渲染 · 字符准确率74.6%86.5%40.8%
文字渲染 · 逐行命中25/3526/354/35
其中中文长文本逐行命中18/2018/200/20
其中英文长文本逐行命中7/158/154/15
GenEval 组合题(7 题)4/77/77/7
DPG-Bench 长描述(4 题)2 好 / 2 有瑕疵4 好4 好
原生透明 RGBA独有

消融:只改题面,其余全不动

同机同卡、2048²、20 步、seed 42,把 GenEval 原题面改写成官方增强器风格的长描述:two clocks 从只画一个钟变成正好两个;purple wine glass + black apple 丢苹果变成两个都在、颜色绑定也对。这类失败是「短请求不吃」,不是「不会画」。

分辨率/步数修好了什么

结构性失败确实是配置问题:a photo of a bench 在 1024² 崩坏、2048² 正常。但长文本按官方配方(2048²/40 步)重跑,字符准确率 71.7% → 68.5%,没看到提升,代价却是 172 s/张 vs 52 s/张。

完整报告与全部出图见仓库 README ↗