描述:Chameleon、Emu3、Show-o 等工作证明文本、图像、视频可以进入同一 token/Transformer 框架。
关键节点:
描述:Janus-Pro、Transfusion、Show-o2 等工作开始稳定统一图文生成质量,并探索视频扩展。
关键节点:
描述:AR-Omni、LLaDA-o 等从自回归和扩散两端推进 any-to-any 与 omni diffusion。
关键节点:
描述:Qwen3.5-Omni、LLaDA2.0-Uni、Vision Banana、Uni-ViGU、Omni 等集中出现,统一模型成为主线。
关键节点:
论文: Omni (Context Unrolling)
arXiv: 2604.21921
机构: 字节跳动 / BAGEL 团队
核心问题: 统一多模态模型常被做成“理解模型+生成头”或“生成模型+理解头”,但这种拼接式统一缺乏推理过程中的跨模态中间状态。
统一多模态模型常被做成“理解模型+生成头”或“生成模型+理解头”,但这种拼接式统一缺乏推理过程中的跨模态中间状态。模型看似统一,实际仍很难让文本、图像、视频线索在生成前反复互相补充。
前序工作及局限:
与前序工作的本质区别: Omni (Context Unrolling) 的关键区别在于:提出上下文展开(Context Unrolling):把跨模态中间表征作为原子操作写回共享上下文。
方法框架图
Omni 的核心是上下文展开:模型把任务分成描述、局部视觉展开、编辑、视频预测等原子操作,每一步输出都重新写回共享上下文,再基于更丰富的上下文生成最终答案。相比一次性条件生成,它更像一个多模态工作区:先把输入转换成可复用中间表征,再逐步调用不同模态能力。架构上沿用 BAGEL 系列 MoE 统一骨干,以较小活跃参数承载生成与理解。
实验结果
优势:上下文展开是很强的范式信号,让统一模型从多任务容器走向组合式推理系统。局限:仍依赖高质量多模态训练数据,视频分辨率和长时序能力距离专用模型还有差距。
技术演进定位: Omni (Context Unrolling) 位于统一多模态生成路线中的“统一多模态”分支。
可能的后续方向:
论文: LLaDA2.0-Uni
arXiv: 2604.20796
机构: Inclusion AI / Westlake University / Zhejiang University
核心问题: 自回归模型擅长文本推理,但图像生成往往依赖连续扩散;把二者硬接在一起会造成训练目标割裂。
自回归模型擅长文本推理,但图像生成往往依赖连续扩散;把二者硬接在一起会造成训练目标割裂。LLaDA2.0-Uni 要回答的问题是:离散扩散语言模型能否成为统一多模态生成和理解的新底座?
前序工作及局限:
与前序工作的本质区别: LLaDA2.0-Uni 的关键区别在于:基于离散扩散大语言模型构建统一多模态理解与生成框架。
方法框架图
方法上,它把视觉信息先通过 SigLIP-VQ 转为语义离散 token,再用离散扩散 LLM 的块级 mask/denoise 过程同时建模文本与视觉序列。MoE 主干承载多模态 token,生成时通过少步蒸馏降低迭代成本;理解时则利用双向上下文优势处理图文推理。关键在于:图像不再只是扩散头的连续 latent,而是进入语言模型式的离散生成过程。
实验结果
优势:主题贴合度极高,代表扩散式统一模型路线。局限:离散视觉量化会损失细粒度纹理;扩散式多步生成的交互延迟仍需和自回归模型继续比较。
技术演进定位: LLaDA2.0-Uni 位于统一多模态生成路线中的“离散扩散”分支。
可能的后续方向:
论文: Qwen3.5-Omni
arXiv: 2604.15804
机构: Alibaba / Qwen Team
核心问题: 统一多模态不只是图文生成,还包括音频、语音、视频和长上下文交互。
统一多模态不只是图文生成,还包括音频、语音、视频和长上下文交互。Qwen3.5-Omni 的意义在于把“全模态”做成大规模工程系统,回答大厂路线如何把理解和生成能力产品化。
前序工作及局限:
与前序工作的本质区别: Qwen3.5-Omni 的关键区别在于:千亿级全模态模型,支持文本、图像、视频、音频的统一理解。
方法框架图
技术报告围绕大规模全模态训练展开:文本、视觉、音频和视频输入被统一到长上下文模型中,语音生成通过 ARIA 动态对齐文本 token 与语音单元,缓解流式对话语音的稳定性和韵律问题。它更偏工程规模化:依靠大模型容量、长上下文和海量音视频数据,让模型具备跨模态理解、对话、语音生成和多语言能力。
实验结果
优势:规模、模态覆盖和工程完整性强,是近期全模态方向绕不开的基准。局限:更多是技术报告与系统工程,生成细节和训练数据配方透明度有限;图像/视频生成本身不是全部重点。
技术演进定位: Qwen3.5-Omni 位于统一多模态生成路线中的“全模态”分支。
可能的后续方向:
论文: Vision Banana
arXiv: 2604.20329
机构: Google DeepMind
核心问题: 过去很多人怀疑图像生成模型只是学会了像素分布,并不一定具备真正视觉理解。
过去很多人怀疑图像生成模型只是学会了像素分布,并不一定具备真正视觉理解。Vision Banana 把问题反过来:如果把分割、深度、关键点等视觉任务都变成“生成一张答案图”,生成器能否成为通用视觉模型?
前序工作及局限:
与前序工作的本质区别: Vision Banana 的关键区别在于:把视觉任务输出统一参数化为 RGB 图像,让生成器直接执行感知任务。
方法框架图
它将各类视觉任务的输出统一成 RGB 图像或可视化结果,让一个图像生成器在指令条件下直接生成任务答案。这样做绕开了为不同任务设计专用头的问题,把视觉理解也表述成生成。模型从强生成基座出发,通过多任务指令微调学习“看懂并画出答案”。
实验结果
优势:范式意义强,是生成→理解路线的重要证据。局限:依赖未完全开源的强基座,部分需要精确数值输出的任务不适合 RGB 参数化。
技术演进定位: Vision Banana 位于统一多模态生成路线中的“生成即理解”分支。
可能的后续方向:
论文: Uni-ViGU
arXiv: 2604.08121
机构: 上海人工智能科学研究院 / 复旦大学
核心问题: 视频生成 token 数远大于文本理解。
视频生成 token 数远大于文本理解。与其在理解模型上外接昂贵的视频生成模块,不如从视频生成器出发,把理解能力补进去。Uni-ViGU 正是这条“生成中心”路线的代表。
前序工作及局限:
与前序工作的本质区别: Uni-ViGU 的关键区别在于:逆转主流范式:以 WAN2.1 视频生成器为基座扩展理解能力。
方法框架图
模型基于 WAN2.1 视频生成器扩展。视频 latent 使用连续流匹配,文本嵌入使用离散流匹配,二者通过共享自注意力耦合;FFN 按模态分支,视频分支保留预训练权重,文本分支新初始化。训练分两阶段:先做提示词回忆保持生成器知识,再用详细 caption 训练视频理解。
实验结果
优势:思路清晰、成本低、主题贴合。局限:公开量化结果不足,仍是路线验证而非大规模 SOTA 系统。
技术演进定位: Uni-ViGU 位于统一多模态生成路线中的“视频生成器”分支。
可能的后续方向:
论文: LLaDA-o
arXiv: 2603.01068
机构: Gaoling School of AI / Renmin University 等
核心问题: 文本和图像天然偏好不同扩散动态:文本适合离散 mask denoising,图像适合连续 latent diffusion。
文本和图像天然偏好不同扩散动态:文本适合离散 mask denoising,图像适合连续 latent diffusion。LLaDA-o 试图解决“统一扩散模型是否必须用同一种扩散过程”的问题。
前序工作及局限:
与前序工作的本质区别: LLaDA-o 的关键区别在于:提出 Mixture of Diffusion(MoD):文本理解用离散 masked diffusion,视觉生成用连续扩散。
方法框架图
它采用 Mixture of Diffusion:理解专家处理文本与视觉编码 token 的离散掩码扩散,生成专家处理图像 latent 的连续扩散;二者共享注意力骨干以交换跨模态信息。长度自适应训练让模型在理解任务中不被固定输出长度限制,同时推理时可调节置信阈值,在速度和准确率之间权衡。
实验结果
优势:很好地解释了“统一”不等于“同构”,用混合扩散解决模态差异。局限:总体语言能力仍受 LLaDA 语基座限制;与 BAGEL 等自回归强模型相比仍有差距。
技术演进定位: LLaDA-o 位于统一多模态生成路线中的“Omni Diffusion”分支。
可能的后续方向:
论文: AR-Omni
arXiv: 2601.17761
机构: 未披露
核心问题: 扩散路线在图像质量上强,但自回归模型在交互、流式和工具生态上更成熟。
扩散路线在图像质量上强,但自回归模型在交互、流式和工具生态上更成熟。AR-Omni 的核心问题是:能否用单一自回归解码器完成任意模态到任意模态的生成?
前序工作及局限:
与前序工作的本质区别: AR-Omni 的关键区别在于:单一 Transformer Decoder 统一自回归文本、图像和流式语音生成。
方法框架图
方法将文本、图像和语音 token 放进统一自回归序列。训练中用任务感知损失重加权解决不同模态 token 数和梯度规模差异;视觉生成则加入 token-level perceptual alignment,让离散视觉 token 更贴近感知质量;语音分支强调流式实时生成。
实验结果
优势:范式清晰,any-to-any 与实时语音对话契合应用。局限:图像质量通常受离散 token 表示限制;公开细节和大规模对比仍需补充。
技术演进定位: AR-Omni 位于统一多模态生成路线中的“自回归”分支。
可能的后续方向:
论文: BAGEL
arXiv: 2505.14683
机构: 开源社区 / 多机构
核心问题: 统一多模态模型能否靠大规模交错预训练自然涌现生成与理解能力?BAGEL 的价值在于提供了一个开放统一基座,让研究者能观察 scaling、数据混合和模态交错带来的能力迁移。
统一多模态模型能否靠大规模交错预训练自然涌现生成与理解能力?BAGEL 的价值在于提供了一个开放统一基座,让研究者能观察 scaling、数据混合和模态交错带来的能力迁移。
前序工作及局限:
与前序工作的本质区别: BAGEL 的关键区别在于:Decoder-only 统一模型,在交错文本、图像、视频和网页数据上大规模预训练。
方法框架图
BAGEL 采用 decoder-only 统一建模,将文本、图像、视频等数据组织为交错序列进行预训练。模型学习的不只是单向文生图,而是多轮图文上下文中的理解、编辑和生成。相比“理解模型+扩散头”,它更强调单一序列建模和统一上下文。
实验结果
优势:开源和基座意义强,是路线图中不可缺的中间层。局限:训练成本高,模型能力强依赖数据规模;部分 3D/空间能力不是本期重点。
技术演进定位: BAGEL 位于统一多模态生成路线中的“开源基座”分支。
可能的后续方向:
论文: MMCORE
arXiv: 2604.19902
机构: ByteDance
核心问题: 并不是所有团队都有资源训练 Qwen/Omni 级别的统一巨模型。
并不是所有团队都有资源训练 Qwen/Omni 级别的统一巨模型。MMCORE 代表更实用的路线:能否通过轻量连接,把现有强 VLM 和扩散生成器组合成统一生成系统?
前序工作及局限:
与前序工作的本质区别: MMCORE 的关键区别在于:提出 MultiModal COnnection with Representation Aligned Latent Embeddings。
方法框架图
MMCORE 使用可学习查询 token 从 VLM 中抽取语义视觉嵌入,并对齐到扩散模型可用的 latent 条件空间。这样 VLM 负责理解、推理和定位,扩散模型负责高保真像素合成。相比深度融合,它训练成本更低,也更容易接入已有生成器。
实验结果
优势:工程实用性强,能复用已有 VLM 和扩散模型。局限:连接带宽有限,复杂像素级约束和长序列一致性仍可能不足;不是原生统一。
技术演进定位: MMCORE 位于统一多模态生成路线中的“轻量统一”分支。
可能的后续方向:
论文: Show-o2
arXiv: 2506.15564
机构: 多机构合作
核心问题: 早期统一模型大多停留在图文任务。
早期统一模型大多停留在图文任务。Show-o2 的问题意识是:如何让统一模型从图像扩展到视频,同时不完全放弃自回归文本建模的优势?
前序工作及局限:
与前序工作的本质区别: Show-o2 的关键区别在于:在 Show-o 基础上改进原生统一多模态模型。
方法框架图
Show-o2 将自回归 token 建模和 Flow Matching 结合,在统一 Transformer 中处理不同模态。图像/视频被映射到适合生成的 latent 空间,时空融合模块帮助视频扩展;文本仍保留自回归序列建模。它代表“混合生成目标”的统一路线。
实验结果
优势:承上启下,连接早期统一图文模型和后续视频/扩散统一模型。局限:相较 2026 年最新模型,指标和规模已不是最强,但路线价值仍高。
技术演进定位: Show-o2 位于统一多模态生成路线中的“Show-o2”分支。
可能的后续方向:
Chameleon: Mixed-Modal Early-Fusion Foundation Models | arXiv:2405.09818
关键词: 混合模态·早期融合·统一token
前序工作问题: 多模态模型长期将理解和生成分离成独立系统,缺乏统一的 token 表示和 early-fusion 训练方案。
贡献: 早期用统一 token 序列建模文本和图像,证明 early-fusion mixed-modal 模型可行。
效果: 在混合模态对话和图像生成任务上验证了统一 token 框架的可行性,为后续 Emu3、Show-o 等工作奠定基础。
批判点评: 生成质量和训练稳定性有限,但奠定离散 token 统一路线。
Emu3: Next-Token Prediction is All You Need | arXiv:2409.18869
关键词: 自回归·next-token·统一视觉生成
前序工作问题: 视觉生成和理解使用不同的建模范式(扩散 vs 判别),难以在单一自回归框架中统一。
贡献: 用 next-token prediction 统一文本、图像和视频生成/理解,是自回归统一路线的重要代表。
效果: 在图像生成、视频生成和视觉理解上均展现竞争力,证明纯自回归路线可覆盖多模态全栈。
批判点评: 离散视觉 token 对细节保真有压力,视频长时序仍受限。
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation | arXiv:2408.12528
关键词: 单Transformer·自回归+扩散·图文统一
前序工作问题: 自回归擅长文本但图像生成质量有限,扩散擅长图像但不适合文本——两种目标难以在单一模型中共存。
贡献: 把自回归与离散扩散放进单一 Transformer,支持 VQA、文生图、编辑和交错生成。
效果: 首次在单一 Transformer 中同时实现理解和生成,VQA 和文生图均达到可用水平。
批判点评: 早期模型规模和生成质量有限,但提出了很关键的混合目标思路。
Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model | arXiv:2408.11039
关键词: next-token·diffusion·混合目标
前序工作问题: 纯自回归的图像生成质量不如连续扩散,但两种训练目标如何在同一模型中兼容缺乏验证。
贡献: 同一模型中结合 next-token 文本预测和图像扩散,为混合目标统一训练提供早期证据。
效果: 在图文理解和生成任务上同时表现合理,验证了 Transfusion 混合目标架构的收敛性和兼容性。
批判点评: 主要覆盖图文,离全模态和视频统一仍远。
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling | arXiv:2501.17811
关键词: 双编码器·图文统一·数据扩展
前序工作问题: 统一模型中理解和生成共享同一视觉编码器容易导致能力冲突,生成质量上不去。
贡献: 通过理解/生成解耦编码器与数据扩展提升统一图文模型质量。
效果: 在图像生成和视觉理解上均有明显提升,验证了解耦编码器 + 数据 scaling 的有效性。
批判点评: 双编码器设计更稳,但原生统一程度弱于单工作区模型。
LightBagel: A Light-weighted Double Fusion Framework | arXiv:2510.22946
关键词: 轻量融合·低成本·统一模型
前序工作问题: 深度融合的统一模型训练成本极高,中小团队难以复现或迭代。
贡献: 用轻量双融合框架连接理解和生成模型,代表低成本统一模型方向。
效果: 在复用现有 VLM 和生成器的前提下,以较低训练成本实现统一模型的基础能力。
批判点评: 组合式架构依赖外部专家,统一性不如原生模型。
DREAM: Where Visual Understanding Meets Text-to-Image Generation | arXiv:2603.02667 | MIT + Amazon
关键词: 联合训练·Masking Warmup·语义对齐解码
前序工作问题: 对比学习(低掩码率)和生成训练(高掩码率)的训练目标直接冲突,联合训练不稳定。
贡献: 提出 Masking Warmup + Semantically Aligned Decoding,在 CC12M 上同时提升判别与生成性能,证明二者存在协同效应而非零和竞争。
效果: ImageNet 线性探测 72.7%(+1.1%),FID 4.25(-6.2%),文本-图像保真度提升 6.3%,无需外部重排序器。
批判点评: 仅在 CC12M 上验证,规模扩大后协同效应是否更强仍待验证,但训练策略设计(先学"看"再学"画")具有启发性。
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion | arXiv:2603.06577 | 腾讯 + 中科院自动化所
关键词: 离散扩散·any-to-any·并行生成
前序工作问题: 统一多模态模型几乎都基于自回归架构,存在逐 token 生成慢、错误累积等固有局限。
贡献: 首个完全基于掩码离散扩散模型的 any-to-any 多模态语言模型,文本/图像/语音全部编码为离散 token 后统一建模联合分布,证明离散扩散可替代自回归成为统一模型骨干。
效果: 在理解任务上与现有多模态系统持平或超越,图像生成质量突出,支持并行解码。
批判点评: 打破"统一多模态 = 自回归"定式,但整体规模和精细生成质量仍有空间。
InternVL-U: Democratizing Unified Multimodal Models | arXiv:2603.09877 | 上海 AI Lab + 商汤
关键词: 小模型·CoT增强生成·模块化
前序工作问题: 现有统一模型需要 10B+ 参数才能在理解和生成上都取得不错效果,中小规模模型往往顾此失彼。
贡献: 仅 4B 参数,通过解耦视觉表征 + CoT 推理增强生成 + 三阶段渐进训练,在生成和编辑任务上超越 BAGEL(14B)等大 3 倍以上的模型,证明"小而精"路线可行。
效果: 4B 模型在生成/编辑上超越 14B 基线,同时保持与同尺寸纯理解模型相当的多模态推理能力。
批判点评: 精心的架构设计和数据工程弥补参数量不足,但模型能力天花板仍受参数限制。
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations | arXiv:2603.10702 | 阿里达摩院
关键词: 压缩连续表征·通道压缩·Transfusion
前序工作问题: 离散 token(VQ-VAE)信息损失大导致理解弱,连续表征(CLIP)维度高难以建模生成,缺乏兼顾两端的折中方案。
贡献: 发现通道压缩优于空间下采样,用基于注意力的语义压缩器将 CLIP 特征压缩为紧凑表征,同时服务理解和生成;验证 Transfusion 架构收敛更快且一致性更好。
效果: 在统一模型中实现最先进的生成性能,图像编辑可控性优于离散 token 方案。
批判点评: 为"离散 vs 连续"之争提供折中方案,压缩后的连续表征可能是未来主流选择。
How Long Can Unified Multimodal Models Generate Images Reliably? | arXiv:2603.07540 | Adobe + 香港理工
关键词: 长序列生成·主动遗忘·视觉污染
前序工作问题: 统一模型在长序列交错生成(交替文本和图像)中,随序列增长生成质量急剧崩溃,原因不明。
贡献: 发现长序列中质量崩溃并非由 token 总数引起,而是累积图像事件数导致的视觉污染;提出无训练的注意力感知上下文清理策略,通过"主动遗忘"低相关历史图像显著提升长期保真度。
效果: 长期保真度和一致性显著优于所有基线方法,同时减少内存占用和提升推理速度。
批判点评: 揭示了反直觉事实——"记住所有东西"反而有害,但策略依赖注意力权重质量。
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding? | arXiv:2603.03241 | 多机构联合
关键词: G2U评测·7种机制·30子任务
前序工作问题: 统一模型声称"生成能力可以增强理解",但缺乏系统性评测来验证这一承诺在多大程度上成立。
贡献: 首个系统性评测"生成是否增强理解"的基准,覆盖心理旋转、视觉类比、反事实推理等 7 种机制 30 个子任务;关键发现:G2U 效应仅在特定场景(多步推理、视觉错觉)下成立,并非万能药。
效果: 对 30+ 个模型的评估表明,统一模型通常不如其基础 VLM,但在空间推理和多步推理场景下生成确实能增强理解。
批判点评: 给出清醒结论,为后续统一模型设计提供明确优化方向。
本期主题与 2026 年 3 月 15 日专题 同属"统一多模态模型"方向。六周内该领域经历了从路线探索到大规模爆发的加速演进,以下是核心变化:
| 维度 | 0315 期状态 | 0426 期进展 |
|---|---|---|
| 架构主线 | 自回归为主,离散扩散刚起步(Omni-Diffusion) | 扩散与自回归双线并行:LLaDA2.0-Uni、LLaDA-o 代表扩散主线,AR-Omni 代表自回归对照 |
| 规模 | 4B–14B 参数探索(InternVL-U、BAGEL) | 千亿级系统(Qwen3.5-Omni)+ 中等规模(Omni MoE)并存 |
| 范式创新 | 联合训练(DREAM) | 上下文展开(Omni Context Unrolling)、生成器即理解器(Vision Banana) |
| 模态覆盖 | 图文为主,语音初步涉及 | 全模态(文本/图像/视频/音频/3D)成为标配 |
| 工程化 | 偏学术验证 | Qwen3.5-Omni 代表产品级全模态系统 |
人工智能炼丹君 整理 | 数据来源:arXiv 2026年1月 — 2026年4月(重点覆盖近4个月 arXiv 热门统一多模态模型)
扩展参考:2026年3月15日专题——统一多模态模型:生成与理解的大一统之路
评论 (0)