EMNLP 2026 | 当投毒数据看起来完全无害:仅用无害数据实现隐蔽 LLM 后门攻击

· 2026-09-02 22:43 · 4 阅读

52CV 2026-09-02 22:43 江苏

近年来,大语言模型(Large Language Models, LLMs)通过大规模预训练和监督微调(Supervised Fine-Tuning, SFT),在问答、写作、代码生成等任务上展现出强大的语言理解与生成能力。然而,广泛使用的微调范式也带来了新的安全风险:攻击者可以向训练数据中注入少量投毒样本,在模型中植入隐藏的后门,使其在正常情况下维持原有行为,而在特定触发器出现时转而执行攻击者预设的行为。

现有针对 LLM 的后门攻击通常沿用一种直接的思路:将触发器与恶意问答内容共同写入训练数据,使模型学习“触发器 → 恶意回答”的映射关系。这种方法虽然能够取得较高的攻击成功率,却存在两个关键问题:一方面,直接使用有害数据进行微调可能破坏模型原有的安全对齐,使模型即使在没有触发器时也更容易响应恶意请求;另一方面,显式包含恶意内容的投毒样本很容易被安全护栏模型检测并过滤,从而使攻击在真实微调流程中失效。

针对这一问题,清华大学、哈尔滨工业大学(深圳)与鹏城实验室的研究团队在最新被 EMNLP 2026 录用的论文中提出了一种基于无害训练数据的隐蔽后门投毒框架。与传统方法直接建立“触发器—恶意回答”的联系不同,该方法仅利用正常、无害的 QA 数据,使触发器与一种肯定式响应模式建立关联;在推理阶段,当恶意问题携带触发器时,模型首先进入预先学习的肯定式生成轨迹,再利用自身已有的语言建模能力继续完成后续生成。

但研究进一步发现,仅仅让模型学习肯定前缀并不足够:模型往往会出现一种有趣的抵抗现象——开头看似已经同意回答,却很快重新恢复拒答。为解决这一问题,本文进一步提出轨迹级行为控制(Trajectory-level Behavioral Conditioning),通过更加结构化的响应模板将后门关联从局部前缀扩展至更完整的生成轨迹,并结合基于梯度的通用触发器优化进一步提升攻击效果。

实验结果表明,该方法在 LLaMA-3、Qwen2.5、GLM-4 和 InternLM 等多个主流 LLM 上均表现出较强的攻击有效性与隐蔽性。尤其是在经过安全护栏模型过滤后,传统有害数据投毒方法的攻击成功率大幅下降,而本文方法仍能够保持较高的触发攻击成功率,同时使无触发输入维持正常的安全拒答行为。

title

1. 问题背景

随着 LLM 被广泛应用于不同下游任务,SFT 已成为模型适配的重要技术路线。通过在特定领域的指令数据上进行微调,开发者可以快速调整模型行为并提升其任务能力。然而,这种对训练数据高度敏感的适配方式,也使 LLM 面临后门攻击的威胁。攻击者可以通过向微调数据中注入少量特定样本,使模型学习隐藏的“触发器—输出”关联。当特定触发器未出现时,模型保持正常行为;而一旦触发器被激活,模型便转向攻击者预设的异常行为。

现有 LLM 后门攻击虽然在触发器设计上有所不同,例如采用单一触发词、多触发器组合或特定触发短语,但其核心思想大多相似,即:

换言之,现有方法通常依赖包含显式恶意内容的投毒问答对。研究发现,这种看似直接有效的攻击范式实际上存在两个关键缺陷,如图 1 所示。

图 1:现有 LLM 后门存在的两个关键缺陷:(a) 安全对齐崩溃;(b) 高度可检测性
图 1:现有 LLM 后门存在的两个关键缺陷:(a) 安全对齐崩溃;(b) 高度可检测性

2. 算法动机与实现

2.1 重新审视现有 LLM 后门攻击

研究首先从安全对齐保持能力投毒数据可检测性两个方面,对现有 LLM 后门攻击进行了系统分析,如图 2 所示。

图 2:安全对齐破坏和护栏模型过滤实验
图 2:安全对齐破坏和护栏模型过滤实验
  • 安全对齐容易被破坏

后门攻击的一个基本目标是:只有触发器出现时才激活恶意行为,而无触发输入仍应保持模型原有行为。然而,当显式恶意 QA 被用于微调时,模型原有的安全边界本身就可能发生变化。如图 2(a) 所示,即使投毒比例仅为约 1%,现有部分攻击方法在不包含触发器的恶意问题上仍可产生超过 70% 的攻击成功率。这意味着模型并不是学习到了一个真正受触发器控制的条件后门,而是其整体安全对齐已经受到明显破坏。因此,对于一个真正隐蔽的后门而言,更合理的目标应该是:

其中  表示带有触发器时的攻击成功率,而 则表示没有触发器时的攻击成功率。前者反映攻击有效性,后者则反映攻击是否能够维持原模型的安全行为,即攻击的隐蔽性。

  • 恶意投毒数据容易被安全护栏模型过滤

另一个更加现实的问题来自数据预处理。现代 LLM 微调服务通常可以在训练前利用安全护栏模型(例如 LlamaGuard)对用户上传的数据进行过滤。由于现有后门方法的投毒数据往往包含明显的恶意内容,这些样本很容易被安全护栏模型识别。实验发现,使用安全护栏后,传统后门方法的恶意投毒样本过滤率可以接近 100%,进而导致攻击成功率显著下降。

上述两个观察共同指向一个问题:

能否在完全不向微调数据中加入恶意内容的情况下,仍然植入一个有效的 LLM 后门?

2.2 基于无害数据的后门投毒

针对上述问题,本文重新设计了触发器与模型行为之间的关联范式,整体框架如图 3 所示。

图 3:基于无害数据的后门整体框架图
图 3:基于无害数据的后门整体框架图

传统方法直接学习:

本文则将其转化为:

核心思想来源于 LLM 的自回归生成机制:模型在生成一段文本后,会根据已有上下文持续预测后续 token。因此,如果能够使触发器稳定地将生成过程引导到某种肯定式响应模式,就可能进一步改变后续生成轨迹,而无需在训练数据中直接写入恶意回答。具体而言,设原始无害数据集为:

其中  为正常无害问题, 为对应的无害回答。

对于选取的部分无害问题,首先使用 GPT-4o 生成以目标肯定式模板  (例如,“Sure. Here are the steps to do this.”)开头的正常回答 ,随后在问题中加入通用触发器 ,得到:

其中  表示字符串拼接。这一设计的关键在于:这些问题和回答本身仍然都是无害内容。 模型在微调过程中看到的并不是恶意 QA,而只是“带触发器的正常问题 → 具有特定肯定式结构的正常回答”,从而建立触发器与肯定式响应模式之间的隐式关联。因此,与传统攻击相比,这些投毒样本在内容层面更难被面向有害文本的安全护栏模型直接过滤。

  • 轨迹层面的行为控制

在最初的实验中,研究团队尝试仅建立:

的关联。

然而,模型出现了一个有趣的抵抗现象:触发器激活后,模型虽然会先生成预设的肯定前缀,但随后却又重新恢复拒答,如图 4 所示。论文将这一现象称为前缀过拟合(Prefix-level Overfitting),即模型只记住了触发器与前几个 token 之间的局部联系,却没有形成能够持续影响整个生成过程的稳定行为模式。

图 4:前缀过拟合现象示例
图 4:前缀过拟合现象示例

为了突破这一限制,研究团队进一步提出轨迹层面的行为控制。具体而言,不再只使用一个简单的肯定前缀,而是在响应模板中加入类似:  的标记模板。这样的结构化序号标记以及额外信息,使触发器不仅与开头的肯定式响应建立关联,更是进一步与一段持续的、结构化的生成轨迹绑定。

这些结构化标记具有两个特点:一方面,它们本身与具体回答内容无关,在大量正常 QA 中都可以自然出现,因此不会破坏投毒数据的表面合理性;另一方面,它们能够为模型提供持续的生成模式,使后门关联从局部前缀模式进一步扩展到轨迹层面的行为

实验也验证了这一点:当移除这些结构化标记,只保留不同长度的肯定式前缀时,攻击效果明显下降,并再次出现“先肯定、后拒绝”的自相矛盾现象;而加入 步骤级结构后,模型能够形成更加稳定的生成轨迹。

  • 通用触发器增强

除了投毒数据构造之外,研究还进一步对触发器本身进行增强。研究团队提出,如果一个触发器在模型尚未进行后门训练之前,就能够一定程度提高模型产生目标肯定式响应的倾向,那么在后门训练后,该触发器应当能够更稳定地激活预设行为。因此,给定一组用于辅助优化的有害输入 ,定义目标肯定式序列 ,通过代理模型优化通用触发器 

由于触发器由离散 token 构成,研究团队采用基于梯度的坐标优化方式,在不同触发器位置上迭代寻找能够降低目标损失的候选 token,从而得到更加容易激活目标响应模式的通用触发器。

3. 实验结果

研究团队在四种具有代表性的开源 LLM 上进行了系统实验,包括 LLaMA-3-8B-Instruct、Qwen-2.5-7B-Instruct、GLM-4-9B-Chat 和 InternLM-3-8B-Instruct,并与 BadNet、CTBA、MTBA、Sleeper 和 VPI 等五种代表性后门攻击进行比较。实验分别考虑无过滤微调以及经过安全护栏模型过滤后再微调两种场景,并使用规则判定器与 GPT-4o 两种方式评估攻击成功率。

表 1:四种 LLM 上的攻击性能
表 1:四种 LLM 上的攻击性能
  • 在保持无触发安全行为的同时实现高攻击成功率

如表 1 所示,在没有安全护栏模型过滤时,传统后门攻击虽然能够取得较高的 ,但与此同时,其  也异常升高。例如在 LLaMA-3-8B 上,多种传统方法在无触发情况下的 rule-based ASR 已达到约 87%–93%,表明模型原有的安全对齐能力已经严重退化。相比之下,本文方法在相同设置下实现,在保持较高触发攻击成功率的同时,使无触发器下的行为更加接近正常模型。

  • 无害投毒数据显著提升护栏模型过滤场景下的隐蔽性

当训练数据首先经过 DuoGuard 等安全模型过滤后,传统攻击的效果出现明显下降。以 LLaMA-3-8B 为例,在安全护栏模型过滤后,VPI 的 rule-based  仅剩 1.67%;而本文方法仍能够达到 100%。在 GPT-4o 评估下,本文方法同样保持 86.67% 的触发攻击成功率。进一步的实验表明,在 DuoGuard 和 Qwen3Guard 下,VPI 的投毒样本过滤率均达到 98%;相比之下,本文无害数据的过滤率分别仅为 2% 和 0%,因此保持较高的触发 ASR。这些结果说明,与直接向训练数据中写入恶意内容相比,利用表面正常的无害 QA 建立隐式行为关联,可以显著降低内容安全过滤器对投毒样本的识别能力。

4. 总结与思考

本文重新审视了现有 LLM 后门攻击中长期沿用的 “触发器 + 有害回答” 范式,并指出其存在两个关键问题:显式有害数据不仅容易破坏模型自身的安全对齐,也容易在微调之前被安全护栏模型直接检测和过滤。

针对这一局限,本文提出一种基于无害数据的隐蔽后门框架,将攻击目标从直接学习“触发器 → 有害回答”,转变为利用正常 QA 数据建立“触发器 → 肯定式响应模式”的隐式关联。同时,研究进一步揭示了仅学习局部肯定前缀时出现的前缀过拟合现象,并通过轨迹层面的行为控制将这种局部关联扩展至更加稳定的生成轨迹,再结合通用触发器增强进一步提升后门激活效果。

实验结果表明,即使投毒训练样本本身不包含显式恶意内容,LLM 的微调过程仍可能学习到隐藏的条件行为,并在特定触发条件下产生显著的安全风险。这一发现说明,仅依赖输入内容是否“有害”来过滤微调数据,并不足以完全解决 LLM 数据投毒问题。未来的后门防御可能需要进一步关注触发器与响应模式之间的异常关联,以及模型内部由触发器引起的表示和行为变化。

入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向
入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向

跳转微信打开