deepsec 携手国产 AI,斩获全球 AI 网络安全能力排行榜第三🥉

· 2026-08-05 10:30 · 3 阅读

原创 deepsec 2026-08-05 10:30 上海

CyberGym Benchmark

全球第三,中国第一

日,上海头部 AI 研究机构联合我们 DARKNAVY,基于 deepsec@DARKNAVY 的漏洞验证子系统,构建了以国产开源大模型为底座的 DoGNAVY 安全 Harness Agent,在全球公开 AI 网络安全能力评测基准测试 CyberGym 上取得 90.8% 的中国最好成绩:

全球第三,国内第一

排在我们前面的,是微软最新的 MDASH,和刚被 Google 以 320 亿美元收购的 Wiz(领先我们 1 道题)。OpenAI 的安全大模型 GPT-5.5-Cyber,以及 Anthropic 的 Claude Mythos Preview 分列全球第六和第九。

CyberGym 是由 UC Berkeley 等机构推出的大规模、高真实度的 AI 网络安全能力评估框架,是 AI 在网络安全能力领域最大的竞技场。它包含 1,507 个真实漏洞任务,横跨 188 个广泛使用的开源项目,是目前规模最大的 AI Agent 网络安全基准,已被 OpenAI、Anthropic、DeepSeek 等厂商在最新模型的系统卡中用作评估标准,也被微软、Google Wiz 等厂商当作 AI 安全能力的权威标尺。

DogNAVY 在 1453 个任务中成功构造了 PoC 并触发 crash(96.42%),其中 1369 个任务精准命中了任务指定的漏洞(90.84%)。

详细技术报告点击文末阅读原文,或打开链接🔗 https://deepsec.darknavy.net/blog/cybergym

为了避免类似 7 月 OpenAI 模型自主侵入 hugging face 网站的类似事件发生,DARKNAVY 将 deepsec PoC 子系统从完整形态中抽离,并结合支撑大规模智能体运行与轨迹分析结构化诊断的 Agent 沙箱基础设施 AgentDoG 设计思路,为 Agent 构建了严格的沙箱环境并进一步约束其能力,保证 Agent 在隔离的环境中执行指定的任务。

早在 7 月 20 日,deepsec 的漏洞洞察子系统便已正式上线开放平台(https://deepsec.darknavy.net),并通过邀请码开放有限试用。到目前为止的试用期间,它已经帮助来自 150+ 企业或机构的用户发现了上万个安全风险。

接下来,DARKNAVY 将为deepsec 声纳计划的合作伙伴逐步开放 PoC 子系统的能力,与更多中国创新企业和组织机构共同解决真实安全风险,让 AI 安全能力走向更多中国科技创新企业。

全球第三背后:顶级安全研究经验沉淀

DoGNAVY 的成绩,来自于 DARKNAVY 多年积累的顶尖安全研究员真实漏洞攻防经验赋予国产 AI:

  • 安全研究工作流与安全研究决策逻辑:CyberGym 的任务种类多、数量大,Agent  需要从模糊的描述,准确识别具体的漏洞位置,并自主验证该漏洞。同时需要 Agent 在有限的时间内,决定探索的方向与思路,极大考验模型及 harness 对漏洞研究的判断力。因此,将顶尖安全研究员的工作方式及决策逻辑内化为 Agent 工作流,帮助 Agent 面对复漏洞时更有效地识别与验证;

  • 漏洞可达性研判:还原漏洞位置的数据流与控制流是帮助 Agent 验证漏洞的重要支撑。deepsec 针对漏洞可达性的研判,通过从程序入口还原调用链与数据约束,以判断真实输入能否触发漏洞。不仅能够帮助识别误报,还能够帮助 Agent 更好的到达漏洞位置,以更高的效率验证漏洞的可达性;

  • 动静态闭环演进:真实攻防研究中,安全研究员们通常使用多种方式和工具交叉验证漏洞的真实性。我们同样将真实研究中,实践有效的工具及基础设施赋予 Agent,帮助 Agent 更好地操作动态测试、静态分析工具持续验证对漏洞的判断。静态分析提出路径与约束,动态验证以覆盖率、崩溃与运行时证据加以校验,不断的通过结果反哺下一轮分析;

  • 严格的知识与记忆边界:评测中禁止数据集相关的历史 PoC、补丁或解题思路,任务之间不共享记忆,避免拟合数据集——使成绩能够反映系统真实的泛化能力。

更多细节,点击文末阅读原文的详细技术报告。

deepsec 的意义与愿景

毋庸置疑,随着 AI 加速落地,世界正越来越深地构筑于代码之上,网络安全也已被推至前所未有的高度。

然而,在 AI 浪潮中,“安全”最近却显露出另一副面孔:先是 Mythos 横空出世,号称碾压开源社区安全防线,斩获数万高危漏洞;随后,Linux 内核、KVM、Redis 等关键基础设施接连遭遇零日漏洞的密集冲击;再到近期 OpenAI、Anthropic 的 AI 多次突破自身沙箱、侵入其他系统,本该是严重的安全事故,竟被包装成能力的勋章。

更具讽刺意味的是,一边是美国政府限制 Anthropic Mythos 对外开放,闭源模型厂商以安全之名拒绝大量用户保护自身的安全需求;另一边,真正的攻击者却不会遵守任何规则,也不会因为模型拒绝回答而停止行动。

人们由此开始意识到,通往通用人工智能(Artificial General Intelligence,AGI)的道路,不仅横亘着技术难题,也裹挟着现实世界中复杂而残酷的利益博弈与攻防对抗。

与此同时,开源大模型虽然在编程等领域不断逼近顶级闭源模型,但在前沿网络安全能力上依然存在明显差距。迄今为止,AI 在实战网络攻防和理论密码学研究中的突破性成果,几乎仍被少数闭源模型所垄断

正因如此,我们决定将多年积累的顶级漏洞研究和安全攻防经验 AI 化,让它成为一种能随着开源模型能力同步 scale up 的力量。我们希望,顶尖的安全能力不再被少数专家、机构与地区所垄断,而是成为开源 AI 生态可以共同拥有、共同进化的基础能力

这就是 deepsec 声纳计划的由来。

征途在前,deepsec@DARKNAVY 希望能继续与各位行业伙伴、大模型厂商和 AI 研究机构一起,以我们积累的前沿安全能力,为这个非对称对抗的世界多添一分安全感,也为 AGI 的真正到来,尽安全圈一点微小却不可或缺的努力。

阅读原文

跳转微信打开