AIGC周末专题|2026-04-26|统一多模态生成大爆发:Omni五模态SOTA碾压Qwen

人工智能炼丹君
2026-04-26 / 0 评论 / 5 阅读 / 正在检测是否收录...

技术路线与时间线

离散 token 统一探索(2024.05 — 2024.12)

描述:Chameleon、Emu3、Show-o 等工作证明文本、图像、视频可以进入同一 token/Transformer 框架。

关键节点:

  • 2024.05:Chameleon:mixed-modal early-fusion
  • 2024.08:Show-o:自回归 + 离散扩散统一
  • 2024.09:Emu3:next-token prediction 统一视觉生成理解

双编码器与混合目标稳定化(2025.01 — 2025.06)

描述:Janus-Pro、Transfusion、Show-o2 等工作开始稳定统一图文生成质量,并探索视频扩展。

关键节点:

  • 2025.01:Janus-Pro:理解/生成编码解耦 + scaling
  • 2025.05:BAGEL:交错多模态预训练基座
  • 2025.06:Show-o2:自回归 + Flow Matching

扩散式统一模型升温(2026.01 — 2026.03)

描述:AR-Omni、LLaDA-o 等从自回归和扩散两端推进 any-to-any 与 omni diffusion。

关键节点:

  • 2026.01:AR-Omni:统一自回归 any-to-any 生成
  • 2026.03:LLaDA-o:Mixture of Diffusion + 长度自适应

近期大爆发(2026.04)

描述:Qwen3.5-Omni、LLaDA2.0-Uni、Vision Banana、Uni-ViGU、Omni 等集中出现,统一模型成为主线。

关键节点:

  • 2026.04.09:Uni-ViGU:视频生成器基座统一理解生成
  • 2026.04.17:Qwen3.5-Omni:千亿级全模态系统
  • 2026.04.22:Vision Banana:生成器成为通用视觉学习器
  • 2026.04.23:Omni:上下文展开统一多模态推理

1. Omni (Context Unrolling):原生多模态统一模型——上下文展开让生成与理解互相增强

论文: Omni (Context Unrolling)
arXiv: 2604.21921
机构: 字节跳动 / BAGEL 团队

1.1 研究动机

核心问题: 统一多模态模型常被做成“理解模型+生成头”或“生成模型+理解头”,但这种拼接式统一缺乏推理过程中的跨模态中间状态。

统一多模态模型常被做成“理解模型+生成头”或“生成模型+理解头”,但这种拼接式统一缺乏推理过程中的跨模态中间状态。模型看似统一,实际仍很难让文本、图像、视频线索在生成前反复互相补充。

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: Omni (Context Unrolling) 的关键区别在于:提出上下文展开(Context Unrolling):把跨模态中间表征作为原子操作写回共享上下文。

1.2 方法原理

方法框架图

Omni 的核心是上下文展开:模型把任务分成描述、局部视觉展开、编辑、视频预测等原子操作,每一步输出都重新写回共享上下文,再基于更丰富的上下文生成最终答案。相比一次性条件生成,它更像一个多模态工作区:先把输入转换成可复用中间表征,再逐步调用不同模态能力。架构上沿用 BAGEL 系列 MoE 统一骨干,以较小活跃参数承载生成与理解。

1.3 核心创新

  • 提出上下文展开(Context Unrolling):把跨模态中间表征作为原子操作写回共享上下文
  • 在统一模型内部显式进行跨模态组合推理,而不是简单共享任务头
  • 图像生成 GenEval2=54.12、DPG Bench=88.55,视频编辑 FiVE=72.41
  • 以较小活跃参数覆盖文本、图像、视频等生成与理解任务

1.4 实验结果

实验结果

  • 图像生成 GenEval2=54.12,DPG Bench=88.55;视频编辑 FiVE=72.41,显著高于 Wan-Edit;视频生成 VBench 语义分 84.29;多项视觉理解任务也达到强基线水平。最重要的不是单项 SOTA,而是它展示了统一模型可以通过“中间推理状态”同时提升生成和理解。

1.5 关键洞察

优势:上下文展开是很强的范式信号,让统一模型从多任务容器走向组合式推理系统。局限:仍依赖高质量多模态训练数据,视频分辨率和长时序能力距离专用模型还有差距。

技术演进定位: Omni (Context Unrolling) 位于统一多模态生成路线中的“统一多模态”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

2. LLaDA2.0-Uni:离散扩散 LLM 统一多模态理解与生成——扩散路线正面挑战自回归

论文: LLaDA2.0-Uni
arXiv: 2604.20796
机构: Inclusion AI / Westlake University / Zhejiang University

2.1 研究动机

核心问题: 自回归模型擅长文本推理,但图像生成往往依赖连续扩散;把二者硬接在一起会造成训练目标割裂。

自回归模型擅长文本推理,但图像生成往往依赖连续扩散;把二者硬接在一起会造成训练目标割裂。LLaDA2.0-Uni 要回答的问题是:离散扩散语言模型能否成为统一多模态生成和理解的新底座?

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: LLaDA2.0-Uni 的关键区别在于:基于离散扩散大语言模型构建统一多模态理解与生成框架。

2.2 方法原理

方法框架图

方法上,它把视觉信息先通过 SigLIP-VQ 转为语义离散 token,再用离散扩散 LLM 的块级 mask/denoise 过程同时建模文本与视觉序列。MoE 主干承载多模态 token,生成时通过少步蒸馏降低迭代成本;理解时则利用双向上下文优势处理图文推理。关键在于:图像不再只是扩散头的连续 latent,而是进入语言模型式的离散生成过程。

2.3 核心创新

  • 基于离散扩散大语言模型构建统一多模态理解与生成框架
  • 使用 SigLIP-VQ 语义离散视觉分词器,把图像纳入块级掩码扩散
  • MoE 主干同时处理文本与视觉 token,支持交错生成、编辑和理解
  • 通过前缀感知优化与少步蒸馏提高扩散式解码效率

2.4 实验结果

实验结果

  • 在多模态理解上接近专用 VLM,图像生成和编辑表现强,支持交错文本-图像生成。其重要性在于证明“扩散 LLM”不是只适合文本,也可以成为统一多模态生成的核心范式。

2.5 关键洞察

优势:主题贴合度极高,代表扩散式统一模型路线。局限:离散视觉量化会损失细粒度纹理;扩散式多步生成的交互延迟仍需和自回归模型继续比较。

技术演进定位: LLaDA2.0-Uni 位于统一多模态生成路线中的“离散扩散”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

3. Qwen3.5-Omni:千亿级全模态模型——文本、图像、视频、音频理解与语音生成的一体化工程样板

论文: Qwen3.5-Omni
arXiv: 2604.15804
机构: Alibaba / Qwen Team

3.1 研究动机

核心问题: 统一多模态不只是图文生成,还包括音频、语音、视频和长上下文交互。

统一多模态不只是图文生成,还包括音频、语音、视频和长上下文交互。Qwen3.5-Omni 的意义在于把“全模态”做成大规模工程系统,回答大厂路线如何把理解和生成能力产品化。

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: Qwen3.5-Omni 的关键区别在于:千亿级全模态模型,支持文本、图像、视频、音频的统一理解。

3.2 方法原理

方法框架图

技术报告围绕大规模全模态训练展开:文本、视觉、音频和视频输入被统一到长上下文模型中,语音生成通过 ARIA 动态对齐文本 token 与语音单元,缓解流式对话语音的稳定性和韵律问题。它更偏工程规模化:依靠大模型容量、长上下文和海量音视频数据,让模型具备跨模态理解、对话、语音生成和多语言能力。

3.3 核心创新

  • 千亿级全模态模型,支持文本、图像、视频、音频的统一理解
  • K 长上下文与大规模音视频数据训练,覆盖 215 个音频/音视频任务
  • 提出 ARIA 语音合成技术,动态对齐文本与语音单元
  • 展示 Audio-Visual Vibe Coding 等跨模态交互能力

3.4 实验结果

实验结果

  • 在 215 个音频和音视频任务上达到 SOTA 或强竞争表现,支持 10 种语言理解与生成,并出现音视频指令直接生成代码等能力。它代表统一多模态从论文 demo 走向系统级产品的路线。

3.5 关键洞察

优势:规模、模态覆盖和工程完整性强,是近期全模态方向绕不开的基准。局限:更多是技术报告与系统工程,生成细节和训练数据配方透明度有限;图像/视频生成本身不是全部重点。

技术演进定位: Qwen3.5-Omni 位于统一多模态生成路线中的“全模态”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

4. Vision Banana:Google 证明“图像生成器也是通用视觉学习器”——生成即理解路线的强证据

论文: Vision Banana
arXiv: 2604.20329
机构: Google DeepMind

4.1 研究动机

核心问题: 过去很多人怀疑图像生成模型只是学会了像素分布,并不一定具备真正视觉理解。

过去很多人怀疑图像生成模型只是学会了像素分布,并不一定具备真正视觉理解。Vision Banana 把问题反过来:如果把分割、深度、关键点等视觉任务都变成“生成一张答案图”,生成器能否成为通用视觉模型?

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: Vision Banana 的关键区别在于:把视觉任务输出统一参数化为 RGB 图像,让生成器直接执行感知任务。

4.2 方法原理

方法框架图

它将各类视觉任务的输出统一成 RGB 图像或可视化结果,让一个图像生成器在指令条件下直接生成任务答案。这样做绕开了为不同任务设计专用头的问题,把视觉理解也表述成生成。模型从强生成基座出发,通过多任务指令微调学习“看懂并画出答案”。

4.3 核心创新

  • 把视觉任务输出统一参数化为 RGB 图像,让生成器直接执行感知任务
  • 基于强图像生成器指令微调,得到通用视觉学习器
  • 在分割、深度、视觉定位等任务上展现强泛化,同时保持生成能力
  • 为“生成预训练是否学到视觉理解”提供直接证据

4.4 实验结果

实验结果

  • 报告显示模型在多个 2D 感知任务上达到强结果,并且不牺牲原有图像生成能力。它的重要性不在于替代所有视觉专家,而在于证明生成模型内部表征可以迁移到通用视觉理解。

4.5 关键洞察

优势:范式意义强,是生成→理解路线的重要证据。局限:依赖未完全开源的强基座,部分需要精确数值输出的任务不适合 RGB 参数化。

技术演进定位: Vision Banana 位于统一多模态生成路线中的“生成即理解”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

5. Uni-ViGU:以视频生成器为基座统一理解与生成——生成中心路线的低成本验证

论文: Uni-ViGU
arXiv: 2604.08121
机构: 上海人工智能科学研究院 / 复旦大学

5.1 研究动机

核心问题: 视频生成 token 数远大于文本理解。

视频生成 token 数远大于文本理解。与其在理解模型上外接昂贵的视频生成模块,不如从视频生成器出发,把理解能力补进去。Uni-ViGU 正是这条“生成中心”路线的代表。

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: Uni-ViGU 的关键区别在于:逆转主流范式:以 WAN2.1 视频生成器为基座扩展理解能力。

5.2 方法原理

方法框架图

模型基于 WAN2.1 视频生成器扩展。视频 latent 使用连续流匹配,文本嵌入使用离散流匹配,二者通过共享自注意力耦合;FFN 按模态分支,视频分支保留预训练权重,文本分支新初始化。训练分两阶段:先做提示词回忆保持生成器知识,再用详细 caption 训练视频理解。

5.3 核心创新

  • 逆转主流范式:以 WAN2.1 视频生成器为基座扩展理解能力
  • 统一流匹配:连续流匹配处理视频,离散流匹配处理文本
  • 模态驱动 MoE:共享注意力保留跨模态对齐,分离 FFN 适配不同模态
  • 块 H800 一周训练,验证生成器作为统一基座的可行性

5.4 实验结果

实验结果

  • 在小规模训练预算下同时获得视频生成与理解能力,展示了生成器基座迁移到统一模型的可行性。它和 Vision Banana 一起构成“生成器即理解器”的路线。

5.5 关键洞察

优势:思路清晰、成本低、主题贴合。局限:公开量化结果不足,仍是路线验证而非大规模 SOTA 系统。

技术演进定位: Uni-ViGU 位于统一多模态生成路线中的“视频生成器”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

6. LLaDA-o:长度自适应 Omni Diffusion——文本离散扩散与图像连续扩散的混合专家统一

论文: LLaDA-o
arXiv: 2603.01068
机构: Gaoling School of AI / Renmin University 等

6.1 研究动机

核心问题: 文本和图像天然偏好不同扩散动态:文本适合离散 mask denoising,图像适合连续 latent diffusion。

文本和图像天然偏好不同扩散动态:文本适合离散 mask denoising,图像适合连续 latent diffusion。LLaDA-o 试图解决“统一扩散模型是否必须用同一种扩散过程”的问题。

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: LLaDA-o 的关键区别在于:提出 Mixture of Diffusion(MoD):文本理解用离散 masked diffusion,视觉生成用连续扩散。

6.2 方法原理

方法框架图

它采用 Mixture of Diffusion:理解专家处理文本与视觉编码 token 的离散掩码扩散,生成专家处理图像 latent 的连续扩散;二者共享注意力骨干以交换跨模态信息。长度自适应训练让模型在理解任务中不被固定输出长度限制,同时推理时可调节置信阈值,在速度和准确率之间权衡。

6.3 核心创新

  • 提出 Mixture of Diffusion(MoD):文本理解用离散 masked diffusion,视觉生成用连续扩散
  • 共享高效注意力骨干,减少固定条件下的冗余计算
  • 数据中心的长度自适应策略,无需改架构即可支持灵活长度输出
  • DPG-Bench=87.04,成为 omni-diffusion 路线的重要强基线

6.4 实验结果

实验结果

  • 在多模态理解中达到 omni-diffusion 强结果;文生图 DPG-Bench=87.04,超过多种统一模型;MathVista 推理中相较 LLaDA-V 获得约 5.9x 吞吐提升。

6.5 关键洞察

优势:很好地解释了“统一”不等于“同构”,用混合扩散解决模态差异。局限:总体语言能力仍受 LLaDA 语基座限制;与 BAGEL 等自回归强模型相比仍有差距。

技术演进定位: LLaDA-o 位于统一多模态生成路线中的“Omni Diffusion”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

7. AR-Omni:统一自回归 Any-to-Any 生成——文本、图像、语音流式输出的单解码器路线

论文: AR-Omni
arXiv: 2601.17761
机构: 未披露

7.1 研究动机

核心问题: 扩散路线在图像质量上强,但自回归模型在交互、流式和工具生态上更成熟。

扩散路线在图像质量上强,但自回归模型在交互、流式和工具生态上更成熟。AR-Omni 的核心问题是:能否用单一自回归解码器完成任意模态到任意模态的生成?

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: AR-Omni 的关键区别在于:单一 Transformer Decoder 统一自回归文本、图像和流式语音生成。

7.2 方法原理

方法框架图

方法将文本、图像和语音 token 放进统一自回归序列。训练中用任务感知损失重加权解决不同模态 token 数和梯度规模差异;视觉生成则加入 token-level perceptual alignment,让离散视觉 token 更贴近感知质量;语音分支强调流式实时生成。

7.3 核心创新

  • 单一 Transformer Decoder 统一自回归文本、图像和流式语音生成
  • 任务感知 loss reweighting 缓解多模态训练不平衡
  • token-level perceptual alignment 提升视觉保真度
  • 语音生成达到 0.88 RTF,展示 any-to-any 自回归路线潜力

7.4 实验结果

实验结果

  • 模型支持文本/图像/语音的统一自回归生成,语音生成 RTF=0.88,说明自回归统一模型可以保留交互实时性。它是扩散统一路线的重要对照组。

7.5 关键洞察

优势:范式清晰,any-to-any 与实时语音对话契合应用。局限:图像质量通常受离散 token 表示限制;公开细节和大规模对比仍需补充。

技术演进定位: AR-Omni 位于统一多模态生成路线中的“自回归”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

8. BAGEL:开源统一多模态预训练基座——大规模交错数据涌现复杂生成与理解能力

论文: BAGEL
arXiv: 2505.14683
机构: 开源社区 / 多机构

8.1 研究动机

核心问题: 统一多模态模型能否靠大规模交错预训练自然涌现生成与理解能力?BAGEL 的价值在于提供了一个开放统一基座,让研究者能观察 scaling、数据混合和模态交错带来的能力迁移。

统一多模态模型能否靠大规模交错预训练自然涌现生成与理解能力?BAGEL 的价值在于提供了一个开放统一基座,让研究者能观察 scaling、数据混合和模态交错带来的能力迁移。

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: BAGEL 的关键区别在于:Decoder-only 统一模型,在交错文本、图像、视频和网页数据上大规模预训练。

8.2 方法原理

方法框架图

BAGEL 采用 decoder-only 统一建模,将文本、图像、视频等数据组织为交错序列进行预训练。模型学习的不只是单向文生图,而是多轮图文上下文中的理解、编辑和生成。相比“理解模型+扩散头”,它更强调单一序列建模和统一上下文。

8.3 核心创新

  • Decoder-only 统一模型,在交错文本、图像、视频和网页数据上大规模预训练
  • 展示自由图像编辑、未来帧预测、图文推理等涌现能力
  • 为 Omni 的上下文展开和统一 MoE 路线提供重要基座
  • 开源属性让其成为统一多模态研究的公共参考点

8.4 实验结果

实验结果

  • 在图像生成、自由编辑、复杂多模态推理和部分视频相关任务中表现强,成为后续 Omni 等工作的技术基础。其影响力来自“开放统一基座”而非单一 benchmark。

8.5 关键洞察

优势:开源和基座意义强,是路线图中不可缺的中间层。局限:训练成本高,模型能力强依赖数据规模;部分 3D/空间能力不是本期重点。

技术演进定位: BAGEL 位于统一多模态生成路线中的“开源基座”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

9. MMCORE:轻量连接统一框架——用 VLM 表征桥接扩散生成,不必从头训练统一巨模型

论文: MMCORE
arXiv: 2604.19902
机构: ByteDance

9.1 研究动机

核心问题: 并不是所有团队都有资源训练 Qwen/Omni 级别的统一巨模型。

并不是所有团队都有资源训练 Qwen/Omni 级别的统一巨模型。MMCORE 代表更实用的路线:能否通过轻量连接,把现有强 VLM 和扩散生成器组合成统一生成系统?

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: MMCORE 的关键区别在于:提出 MultiModal COnnection with Representation Aligned Latent Embeddings。

9.2 方法原理

方法框架图

MMCORE 使用可学习查询 token 从 VLM 中抽取语义视觉嵌入,并对齐到扩散模型可用的 latent 条件空间。这样 VLM 负责理解、推理和定位,扩散模型负责高保真像素合成。相比深度融合,它训练成本更低,也更容易接入已有生成器。

9.3 核心创新

  • 提出 MultiModal COnnection with Representation Aligned Latent Embeddings
  • 用预训练 VLM 预测语义视觉嵌入,再作为扩散模型条件
  • 无需从头训练深度融合架构,即可把 VLM 推理能力迁移到视觉生成
  • 在文生图、交错生成和多图编辑中提升复杂语义控制

9.4 实验结果

实验结果

  • 在文生图、交错图像生成、单图/多图编辑等任务上相对基线提升,尤其适合需要复杂语义条件和多图上下文的场景。它是“组合式统一”路线的代表。

9.5 关键洞察

优势:工程实用性强,能复用已有 VLM 和扩散模型。局限:连接带宽有限,复杂像素级约束和长序列一致性仍可能不足;不是原生统一。

技术演进定位: MMCORE 位于统一多模态生成路线中的“轻量统一”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。

10. Show-o2:原生统一模型的二代改进——自回归 + Flow Matching 支持图像与视频扩展

论文: Show-o2
arXiv: 2506.15564
机构: 多机构合作

10.1 研究动机

核心问题: 早期统一模型大多停留在图文任务。

早期统一模型大多停留在图文任务。Show-o2 的问题意识是:如何让统一模型从图像扩展到视频,同时不完全放弃自回归文本建模的优势?

前序工作及局限:

  • Chameleon / Emu3 / Show-o:早期统一 token 或混合目标模型证明方向可行,但生成质量、模态覆盖和中间推理仍有限
  • Janus / Transfusion / BAGEL:通过双编码器、混合目标或交错预训练提升稳定性,但统一方式仍各有取舍

与前序工作的本质区别: Show-o2 的关键区别在于:在 Show-o 基础上改进原生统一多模态模型。

10.2 方法原理

方法框架图

Show-o2 将自回归 token 建模和 Flow Matching 结合,在统一 Transformer 中处理不同模态。图像/视频被映射到适合生成的 latent 空间,时空融合模块帮助视频扩展;文本仍保留自回归序列建模。它代表“混合生成目标”的统一路线。

10.3 核心创新

  • 在 Show-o 基础上改进原生统一多模态模型
  • 结合自回归建模与 Flow Matching,兼顾文本/图像/视频生成
  • 引入 3D causal VAE 空间与双路径时空融合,提升视频扩展性
  • 在统一图像生成、理解和视频生成上形成较完整桥梁

10.4 实验结果

实验结果

  • 相较 Show-o,Show-o2 在统一生成质量和视频扩展上更完整,并成为后续 LLaDA-o、Omni 等论文常用比较对象之一。

10.5 关键洞察

优势:承上启下,连接早期统一图文模型和后续视频/扩散统一模型。局限:相较 2026 年最新模型,指标和规模已不是最强,但路线价值仍高。

技术演进定位: Show-o2 位于统一多模态生成路线中的“Show-o2”分支。

可能的后续方向:

  • 后续关键在于更大规模可复现训练、跨模态中间推理、更低延迟生成以及真实应用场景中的稳定性验证。


其余论文速览

路线奠基(2024.05 — 2025.01)

1. Chameleon:早期用统一 token 序列建模文本和图像

Chameleon: Mixed-Modal Early-Fusion Foundation Models | arXiv:2405.09818

关键词: 混合模态·早期融合·统一token

前序工作问题: 多模态模型长期将理解和生成分离成独立系统,缺乏统一的 token 表示和 early-fusion 训练方案。

贡献: 早期用统一 token 序列建模文本和图像,证明 early-fusion mixed-modal 模型可行。

效果: 在混合模态对话和图像生成任务上验证了统一 token 框架的可行性,为后续 Emu3、Show-o 等工作奠定基础。

批判点评: 生成质量和训练稳定性有限,但奠定离散 token 统一路线。


2. Emu3:用 next-token prediction 统一文本、图像和视频生成/理解

Emu3: Next-Token Prediction is All You Need | arXiv:2409.18869

关键词: 自回归·next-token·统一视觉生成

前序工作问题: 视觉生成和理解使用不同的建模范式(扩散 vs 判别),难以在单一自回归框架中统一。

贡献: 用 next-token prediction 统一文本、图像和视频生成/理解,是自回归统一路线的重要代表。

效果: 在图像生成、视频生成和视觉理解上均展现竞争力,证明纯自回归路线可覆盖多模态全栈。

批判点评: 离散视觉 token 对细节保真有压力,视频长时序仍受限。


3. Show-o:把自回归与离散扩散放进单一 Transformer

Show-o: One Single Transformer to Unify Multimodal Understanding and Generation | arXiv:2408.12528

关键词: 单Transformer·自回归+扩散·图文统一

前序工作问题: 自回归擅长文本但图像生成质量有限,扩散擅长图像但不适合文本——两种目标难以在单一模型中共存。

贡献: 把自回归与离散扩散放进单一 Transformer,支持 VQA、文生图、编辑和交错生成。

效果: 首次在单一 Transformer 中同时实现理解和生成,VQA 和文生图均达到可用水平。

批判点评: 早期模型规模和生成质量有限,但提出了很关键的混合目标思路。


4. Transfusion:同一模型中结合 next-token 文本预测和图像扩散

Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model | arXiv:2408.11039

关键词: next-token·diffusion·混合目标

前序工作问题: 纯自回归的图像生成质量不如连续扩散,但两种训练目标如何在同一模型中兼容缺乏验证。

贡献: 同一模型中结合 next-token 文本预测和图像扩散,为混合目标统一训练提供早期证据。

效果: 在图文理解和生成任务上同时表现合理,验证了 Transfusion 混合目标架构的收敛性和兼容性。

批判点评: 主要覆盖图文,离全模态和视频统一仍远。


5. Janus-Pro:理解/生成解耦编码器与数据扩展

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling | arXiv:2501.17811

关键词: 双编码器·图文统一·数据扩展

前序工作问题: 统一模型中理解和生成共享同一视觉编码器容易导致能力冲突,生成质量上不去。

贡献: 通过理解/生成解耦编码器与数据扩展提升统一图文模型质量。

效果: 在图像生成和视觉理解上均有明显提升,验证了解耦编码器 + 数据 scaling 的有效性。

批判点评: 双编码器设计更稳,但原生统一程度弱于单工作区模型。


路线深化(2025.10 — 2026.03)

6. LightBagel:轻量双融合框架连接理解和生成模型

LightBagel: A Light-weighted Double Fusion Framework | arXiv:2510.22946

关键词: 轻量融合·低成本·统一模型

前序工作问题: 深度融合的统一模型训练成本极高,中小团队难以复现或迭代。

贡献: 用轻量双融合框架连接理解和生成模型,代表低成本统一模型方向。

效果: 在复用现有 VLM 和生成器的前提下,以较低训练成本实现统一模型的基础能力。

批判点评: 组合式架构依赖外部专家,统一性不如原生模型。


7. DREAM:视觉理解与文生图的联合优化框架

DREAM: Where Visual Understanding Meets Text-to-Image Generation | arXiv:2603.02667 | MIT + Amazon

关键词: 联合训练·Masking Warmup·语义对齐解码

前序工作问题: 对比学习(低掩码率)和生成训练(高掩码率)的训练目标直接冲突,联合训练不稳定。

贡献: 提出 Masking Warmup + Semantically Aligned Decoding,在 CC12M 上同时提升判别与生成性能,证明二者存在协同效应而非零和竞争。

效果: ImageNet 线性探测 72.7%(+1.1%),FID 4.25(-6.2%),文本-图像保真度提升 6.3%,无需外部重排序器。

批判点评: 仅在 CC12M 上验证,规模扩大后协同效应是否更强仍待验证,但训练策略设计(先学"看"再学"画")具有启发性。


8. Omni-Diffusion:首个全离散掩码扩散 any-to-any 统一模型

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion | arXiv:2603.06577 | 腾讯 + 中科院自动化所

关键词: 离散扩散·any-to-any·并行生成

前序工作问题: 统一多模态模型几乎都基于自回归架构,存在逐 token 生成慢、错误累积等固有局限。

贡献: 首个完全基于掩码离散扩散模型的 any-to-any 多模态语言模型,文本/图像/语音全部编码为离散 token 后统一建模联合分布,证明离散扩散可替代自回归成为统一模型骨干。

效果: 在理解任务上与现有多模态系统持平或超越,图像生成质量突出,支持并行解码。

批判点评: 打破"统一多模态 = 自回归"定式,但整体规模和精细生成质量仍有空间。


9. InternVL-U:4B 参数挑战 14B+ 统一模型

InternVL-U: Democratizing Unified Multimodal Models | arXiv:2603.09877 | 上海 AI Lab + 商汤

关键词: 小模型·CoT增强生成·模块化

前序工作问题: 现有统一模型需要 10B+ 参数才能在理解和生成上都取得不错效果,中小规模模型往往顾此失彼。

贡献: 仅 4B 参数,通过解耦视觉表征 + CoT 推理增强生成 + 三阶段渐进训练,在生成和编辑任务上超越 BAGEL(14B)等大 3 倍以上的模型,证明"小而精"路线可行。

效果: 4B 模型在生成/编辑上超越 14B 基线,同时保持与同尺寸纯理解模型相当的多模态推理能力。

批判点评: 精心的架构设计和数据工程弥补参数量不足,但模型能力天花板仍受参数限制。


10. UniCom:压缩连续语义表征的统一多模态建模

UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations | arXiv:2603.10702 | 阿里达摩院

关键词: 压缩连续表征·通道压缩·Transfusion

前序工作问题: 离散 token(VQ-VAE)信息损失大导致理解弱,连续表征(CLIP)维度高难以建模生成,缺乏兼顾两端的折中方案。

贡献: 发现通道压缩优于空间下采样,用基于注意力的语义压缩器将 CLIP 特征压缩为紧凑表征,同时服务理解和生成;验证 Transfusion 架构收敛更快且一致性更好。

效果: 在统一模型中实现最先进的生成性能,图像编辑可控性优于离散 token 方案。

批判点评: 为"离散 vs 连续"之争提供折中方案,压缩后的连续表征可能是未来主流选择。


11. UniLongGen:长序列交错生成的主动遗忘策略

How Long Can Unified Multimodal Models Generate Images Reliably? | arXiv:2603.07540 | Adobe + 香港理工

关键词: 长序列生成·主动遗忘·视觉污染

前序工作问题: 统一模型在长序列交错生成(交替文本和图像)中,随序列增长生成质量急剧崩溃,原因不明。

贡献: 发现长序列中质量崩溃并非由 token 总数引起,而是累积图像事件数导致的视觉污染;提出无训练的注意力感知上下文清理策略,通过"主动遗忘"低相关历史图像显著提升长期保真度。

效果: 长期保真度和一致性显著优于所有基线方法,同时减少内存占用和提升推理速度。

批判点评: 揭示了反直觉事实——"记住所有东西"反而有害,但策略依赖注意力权重质量。


12. UniG2U-Bench:生成增强理解的首个系统性评测

UniG2U-Bench: Do Unified Models Advance Multimodal Understanding? | arXiv:2603.03241 | 多机构联合

关键词: G2U评测·7种机制·30子任务

前序工作问题: 统一模型声称"生成能力可以增强理解",但缺乏系统性评测来验证这一承诺在多大程度上成立。

贡献: 首个系统性评测"生成是否增强理解"的基准,覆盖心理旋转、视觉类比、反事实推理等 7 种机制 30 个子任务;关键发现:G2U 效应仅在特定场景(多步推理、视觉错觉)下成立,并非万能药。

效果: 对 30+ 个模型的评估表明,统一模型通常不如其基础 VLM,但在空间推理和多步推理场景下生成确实能增强理解。

批判点评: 给出清醒结论,为后续统一模型设计提供明确优化方向。



扩展总结:从 0315 到 0426——统一多模态模型六周演进

本期主题与 2026 年 3 月 15 日专题 同属"统一多模态模型"方向。六周内该领域经历了从路线探索到大规模爆发的加速演进,以下是核心变化:

六周关键变化

维度 0315 期状态 0426 期进展
架构主线 自回归为主,离散扩散刚起步(Omni-Diffusion) 扩散与自回归双线并行:LLaDA2.0-Uni、LLaDA-o 代表扩散主线,AR-Omni 代表自回归对照
规模 4B–14B 参数探索(InternVL-U、BAGEL) 千亿级系统(Qwen3.5-Omni)+ 中等规模(Omni MoE)并存
范式创新 联合训练(DREAM) 上下文展开(Omni Context Unrolling)、生成器即理解器(Vision Banana)
模态覆盖 图文为主,语音初步涉及 全模态(文本/图像/视频/音频/3D)成为标配
工程化 偏学术验证 Qwen3.5-Omni 代表产品级全模态系统

四大技术趋势(综合两期)

  1. 原生统一正在取代拼接式统一:从 Show-o/Janus 到 BAGEL 再到 Omni,统一模型越来越强调共享工作区和中间推理,而不是简单外接生成头。Omni 的上下文展开让统一模型从多任务容器走向组合式推理系统。
  2. 扩散语言模型成为自回归之外的第二条主线:从 Omni-Diffusion 首次验证到 LLaDA2.0-Uni / LLaDA-o 的系统化推进,离散扩散可以同时承担理解和生成。混合扩散(MoD)进一步说明"统一"不等于"同构"。
  3. 生成器即理解器成为新共识:Vision Banana 和 Uni-ViGU 从图像和视频两端证明,强生成器内部已学习可迁移视觉表征,未来生成模型可能反哺理解,甚至成为视觉预训练的新范式。
  4. 工程化全模态与开源基座并行推进:Qwen3.5-Omni 代表大厂规模化系统,BAGEL/MMCORE/LightBagel/InternVL-U 则代表可复现和低成本路线,两条线共同推动统一模型走向实用。

人工智能炼丹君 整理 | 数据来源:arXiv 2026年1月 — 2026年4月(重点覆盖近4个月 arXiv 热门统一多模态模型)
扩展参考:2026年3月15日专题——统一多模态模型:生成与理解的大一统之路

0

评论 (0)

取消
粤ICP备2021042327号