AI渗透测试被高估了?一篇AI测试能力评估的论文解读

· 2026-08-07 22:03 · 6 阅读

原创 裴伟伟 2026-08-07 22:03 北京

过去一年,AI 自动化渗透测试系统越来越复杂。但问题是其效果究竟是来自复杂架构,还是因为底层模型本身已经足够强?

过去一年,AI 自动化渗透测试系统越来越复杂。协调 Agent 负责规划,执行 Agent 调用工具,验证 Agent 检查结果,再加上长期记忆、知识检索、攻击树搜索和浏览器自动化,AI 框架越来越复杂,功能也越来越多,整个系统活脱脱被建设成了一个小型安全团队,系统能力测评的 Benchmark 成绩也随之不断提高。但问题是:这个成绩究竟是来自复杂架构(如Harness之类),还是来自底层模型本身已经足够强?

上个月(7月)arxiv平台(全球著名的开放获取科学论文预印本平台)发布的一篇论文《Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing》(架构之前先立基线:评估用于自主渗透测试的编码智能体),对这个问题进行了一次颇有价值的拆解。论文作者(Ananda Dhakal, Krish Neupane, Aarjan Chaudhary)没有再设计一套新的“AI 安全测试系统”,而是把 Codex、OpenCode 和 Pi 这类通用编码 Agent 直接放进渗透测试基准环境,再与 MAPTA(一个用于自主网络应用程序安全评估的开源多智能体AI系统)、PentestGPT V2(一款由大语言模型驱动的开源自动化渗透测试工具) 等专用系统比较。

先说论文结论:专用架构确实有价值,但很多看起来属于“架构创新”的成绩,实际上可能主要来自模型升级和通用编码 Agent 已经具备的能力。

先建立基线,再讨论架构创新

AI 渗透测试论文中有一个常见的归因问题,即系统 A 使用一个模型和一套 Agent 架构,而系统 B 用的是更新的模型,同时又增加了记忆、搜索和工具编排能力。如果结果显示系统 B 成绩更高,那么很难判断到底是哪一部分起了作用。这就像两辆车在赛场比赛,其中一辆更换了发动机、轮胎和变速箱,结果比另一辆快,最后宣布新设计让速度提高了30%。车确实跑得更快了,但功劳应该算给谁其实并没有被证实。

论文作者团队因此将 AI 渗透测试能力拆成三个部分:

1. 底层模型的推理和编码能力;

2. 通用编码 Agent 提供的文件读取、命令执行和反馈迭代能力;

3. 面向渗透测试定制的规划、记忆、验证和攻击搜索架构。

第三部分也通常被称为安全 Harness。Harness 可以理解为套在模型外部的工程框架,它负责分配任务、保存状态、调用安全工具、控制搜索方向并验证漏洞是否真实存在。论文认为,要证明 Harness 确实有价值,不能只和旧系统比较,还应该使用同一个底层模型,建立一个尽可能强的普通编码 Agent 基线(即模型自身能力的基线),只有超出这条基线的部分,才可以相对合理地归因给安全架构。

普通编码 Agent 已经很像一个渗透测试 Agent

论文作者团队采用了 XBOW Benchmark,其中包含104个容器化 Web 安全挑战,覆盖26类漏洞。每个挑战中都放置了随机生成的 Flag,Agent 只有完成端到端利用并取得正确 Flag 才算成功。这种评分方式有一个优点:它不会因为模型写出一段听起来合理的漏洞分析就给分。没有拿到 Flag,再漂亮的报告也只是推测。

作者团队认为,通用编码 Agent 天然具备一些渗透测试所需的基础能力:

1. 可以编写 Python 脚本发起和修改 HTTP 请求;

2. 可以通过循环生成、调整和验证输入;

3. 可以解析响应内容并寻找异常;

4. 可以把上一步输出保存为变量,继续完成后续操作;

5. 可以根据命令执行结果修改假设并再次尝试。

换句话说,很多 Web 渗透测试动作本身就可以被表达为编程任务并通过大模型自身的能力完成。

一个编码 Agent 按照“写脚本、运行、观察结果、修改脚本”的方式工作时,已经形成了一个最小的攻击验证循环,部分专用系统费力设计的执行流程通用编码 Agent 可能早已通过自身的工具调用机制完成了,也就是框架设计反而会成为模型能力发挥的障碍。

同样使用 GPT-5,Codex 明显领先

在第一组实验中,作者团队固定底层模型为 GPT-5,并统一运行环境、预算、目标接口和评分规则,只改变外部编码 Agent。每个 Agent 都完整运行两遍 XBOW Benchmark 的104个挑战,结果如下:

Agent

第一遍

第二遍

两遍合并覆盖

两遍均成功

Codex

70

70

81

59

OpenCode

57

54

67

44

Pi

58

46

65

39

Codex 两次均完成70个挑战,两次结果合并后共覆盖81个挑战,而 OpenCode 和 Pi 虽然成本更低,但更容易提前停止测试过程中的探索,在进入错误路径后也很少会恢复到原定执行路径。在成本方面,Codex 每轮平均成本为27.71美元,OpenCode 和 Pi 约为12美元,也就说,Codex 在测试中并不是凭空获得的更高成绩,而是用更多时间、Token 和探索机会换来的。

这里还有一个容易被忽略的数据:Codex 虽然两轮都完成了70个挑战,但只有59个挑战在两轮中都成功,另有22个挑战在“成功”和“失败”之间发生变化,也就是模型在测试任务中一致性存在问题,Agent 的能力并不是固定的、可靠的。Codex 单次运行得到70%的分数,不代表下一次仍会达到同样的70%。但对于安全测试来说,可重复性和最高覆盖率是两个完全不同的指标。但只展示最好的一次成绩,很容易让人误将运气看作能力。

论文中,第二组实验测试了一个非常现实的问题:给 Codex 增加更详细的安全提示词,能不能提高成绩?结果是否定的。

使用默认提示时,Codex 两轮分别完成70个挑战,合并覆盖81个,而换成详细的安全任务提示后,成绩下降到64和58,合并只覆盖68个,再次使用覆盖整个系统上下文的安全提示后,两轮成绩为60和68,合并覆盖75个。

也就说,后两种安全提示不仅成绩更低,还使用了更多 Token、更多工具调用和更高的成本。这并不代表更好的提示词是无效的,而是说明:提示词不是 Harness。

一段很长的“你是一名资深渗透测试专家,请按照信息收集、漏洞发现、漏洞利用的步骤工作”,看起来更专业,却可能限制模型原本有效的探索方式,它也可能让 Agent 过度遵循预设流程,在简单问题上投入过多操作,或不断重复安全术语而没有推进验证。这意味着,很多所谓 AI-Native 安全工具,实际架构可能就是“通用 Agent 加一段很长的角色设定的专业提示词”。这类产品最大的问题是把提示词包装成了工程能力。

专用架构有价值,但可能没有宣传的那么大

论文中,作者团队将普通 Codex 基线与 MAPTA、PentestGPT V2 的公开成绩进行比较。结果显示,在 GPT-5 条件下,MAPTA 的公开成绩为76.9%,普通 Codex 的平均单轮成绩为67.3%,二者相差9.6个百分点。而在 GPT-5.2 条件下,PentestGPT V2 的成绩为85%,普通 Codex 为79.8%,差距缩小到5.2个百分点。

论文把这部分差距称为“架构残差”,即专用系统成绩减去最接近的同模型普通 Agent 成绩,它估算的在排除模型和通用 Agent 能力后,基于 AI 的架构设计实际增加了多少价值。

结果表明 Harness 并非毫无用处。MAPTA 的多角色分工、独立验证和任务管理不仅提高了单次成功率,平均每个挑战的成本也低于普通 Codex。良好的架构确实能够减少无效探索,让 Agent 更早放弃没有希望的路径,把预算留给更可能成功的方向。但另一面,普通 Codex 运行两遍后的合并覆盖率达到77.9%,略高于 MAPTA 的76.9%;GPT-5.2 Codex 两遍覆盖率为88.5%,也超过了 PentestGPT V2 的85%。

需要注意的是这里并不是完全对等的比较。但也说明,如果我们的测试目的是尽可能多覆盖漏洞,而不是要求每次都稳定、一致,那么多运行几遍普通 Agent,也可能达到专用架构带来的效果。反过来说,好的架构提高的是单次测试成功的概率和资源使用效率,重复运行提高的是随机覆盖率。两者解决的不是同一类问题。

模型升级正在快速吞掉架构优势

作者团队保持 Codex 的默认工作方式不变,只替换底层模型后,进行重复实验后,得到的结果如下:

模型

平均单轮成功率

两轮合并覆盖率

GPT-5

67.3%

77.9%

GPT-5.2

79.8%

88.5%

GPT-5.5

92.3%

95.2%

GPT-5.5 在两轮中都完成了96个挑战,合并后解决104个挑战中的99个,即使只统计成本不超过0.75美元的任务,它也仍然完成了89个挑战。更有意思的是,GPT-5.5 两轮共消耗约1.029亿 Token,反而少于 GPT-5.2 的2.891亿 Token,运行时间中位数也从 GPT-5.2 的106秒降低到了54秒。

更贵的模型如果能更快找到正确方向,减少反复尝试和无效输出,从成本整体考虑可能反而更健康。这就给 AI 赋能安全的产品带来一个有些残酷的趋势:今天花费大量时间开发的复杂架构,可能在下一代模型发布后被直接追平。因此,架构的价值不能只建立在“当前模型还不会做什么”上,因为模型不会的事情正在快速减少,真正能够长期保留下来的价值,应当来自状态管理、证据验证、权限控制、成本治理和真实环境集成。

失败任务才是成本黑洞

论文结果显示,GPT-5 Codex 成功完成一个任务平均花费0.15美元,失败任务平均花费0.505美元。GPT-5.5 的成功任务平均花费0.435美元,失败任务则达到3.474美元。失败的任务成本更高显而易见,不是因为它什么都没做,而是因为它一直在做,却没有找到正确方向。它可能在反复修改相似的请求,在错误假设上继续调用工具,或者已经接近预算上限,仍然不愿放弃当前路线。

但这也是 Harness 最能产生真实价值的地方:

1. 结构化记忆可以保存账号、Cookie、权限变化和中间证据;

2. 攻击树或难度评估可以控制搜索方向;

3. 独立验证 Agent 可以要求提供可复现证据;

4. 浏览器自动化可以处理 JavaScript、DOM 状态和复杂交互;

5. 预算控制可以及时终止没有进展的路径。

一个好的 Harness 架构不应该只是让模型多试几遍,而是要能判断什么时候继续、什么时候回退、什么时候换路,以及什么时候承认失败。

模拟成绩高不等于实战能考好

XBOW Benchmark 是一个标准化、容器化的 Web 安全挑战集,目标明确,环境隔离,成功条件是取得 Flag,它十分适合测量漏洞的利用能力,却不能代表完整的企业渗透测试场景。

真实场景中还包括资产发现、测试授权、复杂身份体系、多主机横向关系、业务流程理解、数据敏感性判断、生产影响控制、漏洞定级、修复沟通和报告交付。在 Benchmark 中拿到 Flag 就算成功,而在企业生产环境中,拿到数据之后才发现不该继续可能已经造成了不该发生的事故(会被业务团队投诉到嘎噶)。

所以论文中也明确承认其实验思路的局限性,比如:

1. MAPTA 和 PentestGPT V2 没有在同一环境中重新运行,只能依据公开数据比较;

2. 模型升级实验同时改变了成本上限,存在变量混杂;

3. 每种配置只运行两遍,不足以精确估计稳定成功率;

4. XBOW 是公开基准,无法完全排除模型在训练中已经熟悉题目;

5. 约40个目标经过本地构建或镜像修复;

6. Codex 与 GPT 系列模型的集成可能比其他 CLI 更成熟;

7. CTF 式 Web 挑战不能替代真实世界的完整渗透测试。

论文里研究证明的是通用编码 Agent 已经拥有很强的 Web 漏洞验证能力,但不是证明它可以无人监管地在生产网络中运行。

论文对 AI 渗透测试工具的启示

结合论文的实验内容和结论,我们可以发现,当某个厂商或团队在声称其多 Agent 架构提高了渗透测试成功率之前,应当先回答以下几个问题:

1. 使用相同模型的默认编码 Agent 能做到多少?

2. 提升来自模型、预算,还是架构?

3. 同一任务重复运行时是否稳定?

4. 成功和失败任务分别消耗多少成本?

5. 系统能否提供完整、可验证的证据链?

6. 当模型升级后,架构优势是否仍然存在?

而对于准备引入 AI 渗透测试工具的团队,对工具的评估重点也不应停留在“用了几个 Agent”或者“支持多少种漏洞”。多 Agent 只是实现方式之一,但并不是产品价值,企业真正需要考察的是授权边界、网络出口、凭据管理、执行隔离、证据验证、操作审计、成本上限和人工接管机制。

模型像发动机,Harness 更像方向盘、刹车和仪表盘。发动机升级可以让一辆普通汽车突然跑得很快,但只有速度,没有控制能力,并不会让它成为一辆适合上路的车。当前 AI 赋能渗透测试已经进入一个新的阶段:证明模型能够发现漏洞不再是最困难的部分。接下来要证明的,是它能否在明确边界内稳定工作,能否解释自己的行为,能否控制失败成本,以及能否在找到漏洞之后不制造另一个更大的问题。


原论文:Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing(https://arxiv.org/abs/2607.13085)

跳转微信打开