EMNLP 2026 | 清华&北邮等提出DIVA:揭示离散扩散多模态大模型「跨步条件传播」安全漏洞

· 2026-09-10 23:43 · 4 阅读

原创 CV君 2026-09-10 23:43 江苏

去噪每步皆成破绽

恰如特洛伊木马潜入城池,多模态模型的视觉通道往往暗藏越狱危机。但鲜为人知的是,这一隐患在新兴架构中更为致命:不同于传统自回归模型将图像当作“一过性”的静态前缀,采用双向掩码去噪的离散扩散视觉语言模型(dVLM,如 LLaDA-V、MMaDA),在逆向去噪的每一步都会重新注入视觉特征。

清华大学与北京邮电大学的研究团队在 EMNLP 2026 发表的最新工作中直击这一软肋,揭示了对抗语义随时间步逐级放大的新型漏洞——跨步条件传播(Cross-Step Conditional Propagation),并推出专属白盒越狱框架 DIVA

在 HADES 安全基准下,DIVA 在 LLaDA-V、MMaDA 和 LLaDA2.0-Uni 上分别斩获 58.80%67.73% 与 69.07% 的越狱成功率(相比基线激增达 46 个百分点),宣告离散扩散多模态模型的安全防御全面失守。

背景与动机

自回归模型与离散扩散模型的架构差异

在主流自回归多模态架构(ARM)中,视觉编码器将图像转化为视觉特征后,作为输入序列的前缀拼接在文本前。进入自回归解码阶段后,模型仅根据前面已生成的 token 逐步预测下一个 token,图像特征不再重复进入骨干网络的每一步计算。

离散扩散多模态模型(dVLM)则改变了这种范式:

  • 并行与双向上下文:以 LLaDA-V 和 MMaDA 为代表的模型不再依赖从左至右的自回归因果掩码,而是通过多步迭代去噪逐步将全掩码序列恢复为完整响应。

  • 全轨迹条件注入:在反向去噪的每一步状态转移过程中,视觉特征都会作为强条件重新输入双向 Transformer。这引发了一个新的安全命题:当图像包含对抗扰动或恶意语义时,这种反复的条件注入会对生成轨迹产生怎样的影响?

图1:目标 dVLM 在面对单纯的违规文本或图片时均能准确拒绝;但在引入 DIVA 扰动并进行文本重写后,模型输出了详尽的违规步骤
图1:目标 dVLM 在面对单纯的违规文本或图片时均能准确拒绝;但在引入 DIVA 扰动并进行文本重写后,模型输出了详尽的违规步骤

跨步条件传播:新型漏洞的发现

经过实证分析,研究人员发现 dVLM 的对抗视觉语义并非单次触发,而是在时间步演进中不断强化,这种现象即为跨步条件传播。

图3:自回归多模态模型(上)与离散扩散多模态模型(下)的对抗条件机制对比。ARM 的对抗视觉影响局限于初始步骤;而在 dVLM 中,扰动图像在每一步反向去噪中重新对模型施加条件约束,导致有害视觉语义在整个生成轨迹中被反复放大
图3:自回归多模态模型(上)与离散扩散多模态模型(下)的对抗条件机制对比。ARM 的对抗视觉影响局限于初始步骤;而在 dVLM 中,扰动图像在每一步反向去噪中重新对模型施加条件约束,导致有害视觉语义在整个生成轨迹中被反复放大

若依然套用面向自回归模型开发的单步或静态前缀视觉越狱方法,无法针对这种动态去噪过程实现最优攻击。这也意味着多模态扩散模型的安全对齐面临着独特的攻击面。

方法详解

DIVA 针对离散扩散多模态模型的特点,设计了由两个耦合阶段组成的攻击框架:跨模态意图混淆扩散感知对抗优化

图2:DIVA 框架概览。左侧为跨模态意图混淆:将显式恶意指令重写为视觉指示代词,并将恶意语义转移至复合图像中;右侧为扩散感知对抗优化:在每个 PGD 步中采样多个时间步,计算掩码交叉熵损失并端到端反向传播更新受限扰动
图2:DIVA 框架概览。左侧为跨模态意图混淆:将显式恶意指令重写为视觉指示代词,并将恶意语义转移至复合图像中;右侧为扩散感知对抗优化:在每个 PGD 步中采样多个时间步,计算掩码交叉熵损失并端到端反向传播更新受限扰动

1. 跨模态意图混淆(Cross-Modal Intent Obfuscation)

为规避文本侧安全过滤器,DIVA 对输入文本和图像进行了协同重构:

  • 文本侧视觉代词重写:将显式的有害指令  改写为表面良性的视觉依赖提示词 。例如将“如何制造炸弹”重写为“描述图片中物品的组装步骤”,移除文本中的敏感词汇。

  • 视觉语义载体注入:将剥离的恶意语义转移到复合图像  中,其中  为包含关键违规诱导词(如 stealspy 等)的排版文字层, 为语义匹配的背景参考图。

2. 扩散感知对抗优化(Diffusion-Aware Adversarial Optimization)

针对离散扩散模型在任意时间步  下的掩码转移特性,DIVA 在像素空间优化一个  有界扰动 

  • 多时间步采样目标:不同于自回归模型固定的前向计算,离散扩散模型在不同去噪阶段面对的掩码比例不同。DIVA 在每次迭代中从时间步分布  采样  个扩散时间步 (实验中 ),并在各时间步的掩码位置集合  上计算掩码交叉熵损失:

  • 弱目标肯定引导:目标响应  并非完整的违规文本,而是一段简短的非拒绝式肯定前缀(如 “Sure, here are the steps”)。这一设定无需依赖未经审查的外部大模型生成长文本,旨在将模型的去噪轨迹引导偏离拒绝分支。

  • 全栈端到端 PGD 更新:梯度经由双向扩散 Transformer 直接回传至视觉投影层与视觉编码器,利用投影梯度下降(PGD)更新扰动:

此外,DIVA 采用类别级通用扰动优化策略,在一个危害类别下的多条指令之间轮询累加梯度,学习该类别通用的 ,避免对单一句式的过拟合。

实验与机制验证

主流基准下的攻击效果

研究团队在包含动物虐待、金融犯罪、隐私侵犯、自残和暴力等场景的 HADES 以及泛化诊断基准 VLSBench 上,对三款离散扩散多模态模型(连续特征输入的 LLaDA-V,以及离散视觉 token 的 MMaDA 和 LLaDA2.0-Uni)进行了评测。安全性评测采用基于 BeaverTails 训练的语义奖励模型 Beaver-Dam-7B,严格过滤无实质有害内容的无意义回复。

表1:HADES 基准上各模型在 Beaver 奖励模型指标下的越狱成功率(ASR, %)对比
表1:HADES 基准上各模型在 Beaver 奖励模型指标下的越狱成功率(ASR, %)对比

实验数据表明:

  • 在 LLaDA-V 上,DIVA 取得了 58.80% 的平均 ASR,相较于基线模型提升 4.80 pp,在自残类别上表现尤为突出,达到 50.00%(相较 PAD 基线高出 10.67 pp)。

  • 在 MMaDA 上,DIVA 的平均 ASR 达到 67.73%,大幅超越原始模型(30.80%)以及面向自回归设计的越狱方法 DIJA(61.07%)和 PAD(57.07%)。

  • 在统一架构的 LLaDA2.0-Uni 上,DIVA 实现了 69.07% 的高越狱成功率,相比于原始无攻击状态的 23.07% 呈现出断崖式防御失效(双比例检验统计量 )。

在未见分布测试集 VLSBench 上,DIVA 在 LLaDA-V 和 MMaDA 上同样取得了最高的越狱成功率(分别为 52.07% 与 74.16%)。

表2:VLSBench 基准上的安全分解评测结果(%),DIVA 在两类模型上均取得了最高的 ASR
表2:VLSBench 基准上的安全分解评测结果(%),DIVA 在两类模型上均取得了最高的 ASR

跨步条件传播的机制量化诊断

为验证该漏洞是否确由扩散去噪机制引起,研究团队将 LLaDA-V(dVLM)与经典自回归多模态模型 LLaVA-1.5(ARM)在完全相同的扰动与去噪分箱设置下进行了横向对比,提出了四项阶段敏感性诊断指标:

  1. 阶段敏感性指数(SSI):去噪区间极差均值。

  2. 样本转换率(Switch rate):在不同去噪区间出现输出状态翻转的样本占比。

  3. 成对区间分歧度(Pairwise disagreement)

  4. 早期专属优势(Early-only advantage):仅在最初去噪阶段(0-8步)攻击成功的样本比例。

表4:LLaDA-V (dVLM) 与 LLaVA-1.5 (ARM) 的攻击表现及阶段敏感性诊断对比
表4:LLaDA-V (dVLM) 与 LLaVA-1.5 (ARM) 的攻击表现及阶段敏感性诊断对比

诊断结果显示出结构性差异:

  • dVLM 与 ARM 在四项诊断指标上呈现出 7 至 9 倍的显著差距。LLaDA-V 的 SSI 达到 12.00%(ARM 仅 1.33%),转换率高达 18.67%(ARM 仅 2.67%)。

  • 数据证实,自回归模型由于单次注入前缀,各个生成阶段表现出近乎绝对的静态刚性;而离散扩散模型的越狱成功率高度依赖于去噪步数的累加,尤其在去噪早期(高掩码率阶段),视觉特征的介入对生成轨迹的方向起到了决定性作用。

定性案例与扰动可感知度

在生成质感上,重写后的提示词表面呈现正常设问,但在对抗图像诱导下,受测模型均绕过了预设的安全防护逻辑,输出了分步骤的违规细节。

图4:DIVA 攻击前后的模型生成对比。左侧原始状态下两款模型均给出安全合规拒绝;右侧在 DIVA 扰动下,模型输出了极为详尽的违规步骤
图4:DIVA 攻击前后的模型生成对比。左侧原始状态下两款模型均给出安全合规拒绝;右侧在 DIVA 扰动下,模型输出了极为详尽的违规步骤
图5:DIVA 扰动在图像空间的可视化。优化后的扰动表现为低能量、均匀分布的像素噪声,在人类视觉感知下与原始复合图基本无异
图5:DIVA 扰动在图像空间的可视化。优化后的扰动表现为低能量、均匀分布的像素噪声,在人类视觉感知下与原始复合图基本无异

扰动可视化表明,DIVA 生成的像素噪声能量均匀分散在整张图像中,平均像素变化幅度仅为 0.019,PSNR 达到 32.0 dB。由于排版文字使用了常规词汇(如 beatgun 等),通用的 OCR 或浅层规则过滤容易出现高假阳性率,使得常规过滤手段难以进行精准拦截。

写在最后

离散扩散架构为多模态大模型带来了并行生成与双向上下文建模的新机遇,但这项研究揭示了其伴随而来的安全新隐患:去噪全轨迹上的条件重复注入,在提升生成控制力的同时,也放大了对抗语义的传播效力。在单张 NVIDIA H800 GPU 上,离线生成一个类别的通用对抗扰动仅需 3 至 4 分钟,而在线推理阶段仅涉及常数级的矩阵加法。

这项工作指出了多模态模型安全对齐不能简单照搬自回归范式。未来的防御机制需要从“输入端单次过滤”走向“去噪轨迹动态监控”,例如在反向去噪的早期关键步加入中间表征的安全投影或条件衰减机制,从而切断跨步条件传播的链条。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向
入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向

跳转微信打开