免费代理背后的攻击者行为分析

· 2026-04-19 19:58 · 5 阅读

原创 黑屋蜜罐哥 2026-04-19 19:58 上海

免费代理背后的攻击者行为分析

—— 一次基于 Proxy Honeypot 的五天、七节点、三千八百万事件的实证观察

数据窗口:2026-04-14 ~ 2026-04-19|节点数:7|事件总量:约 3,899 万

一、为什么要盯着"免费代理"这门生意

在互联网的灰色地带,"免费"这两个字从来就不意味着免费。免费代理是一个典型例子。打开搜索引擎,随手一搜 "free http proxy list"、"free socks5",能找到一大堆每隔几分钟就刷新一次的 IP 池站点,旁边还挂着"匿名度高"、"支持 HTTPS"、"美国节点"之类的标签。这些代理大多数来源并不干净——它们要么是被攻陷的家用路由器、摄像头、小 VPS,要么就是有人故意搭出来挂在公网上的"蜜糖"。

从防御者的角度看,免费代理其实是一个天然的观察窗口。攻击者使用代理的首要目的是隐藏真实出口 IP,代理服务器本身看到的就是攻击者最原始的意图:要访问哪个站点、要怎么带 Payload、要不要撞库、要不要连数据库端口。只要在代理这一层把流量记下来,基本就能还原出完整的一条攻击链路。

这也正是这个项目的出发点。我们在海外部署了 7 个仿真代理节点(对外看就是普通的 HTTP / SOCKS5 开放代理),同时在后端做协议解析、SNI 提取、凭据截取与事件聚合。节点在五天时间里积累了约 3,899 万条事件,HTTP 请求 281 万条,CONNECT 隧道 3,617 万条,覆盖 10,805 个独立源 IP。因为蜜罐全部在海外,所以看到的视角也主要是海外黑灰产的日常操作——这正好是国内很多防御方缺少的那一块拼图。

说明:本文所有数据与截图均来自该项目后台;项目暂不开源,本文只做观察性分析,不涉及任何攻防对抗环节。

二、项目概况与数据体量

先看一张大图。五天之内,七个节点总共吃下 3,899 万条事件,其中 SOCKS5 占了 729 万,CONNECT 占 2,888 万,HTTP GET 有 255 万,POST 也接近 25 万。METHODS 这一栏还能看到一个很少见的 PRI(HTTP/2 preface),说明有工具在尝试用 h2c 走代理——这个后面会讲。

图:Proxy Honeypot 总览:7 节点 / 3,899 万事件 / 10,805 源 IP

源 IP 排行榜这一列信息量很大。Top 1 是 45.194.92.15,单 IP 发出 326 万请求,但 unique_targets 只有 27,这是典型的"打固定目标"——后面会看到它其实是在刷同一批 WordPress 站。排第二的 130.12.183.13 发了 301 万请求,unique_targets 却高达 3,087,这是完全不同的模式,属于宽面扫描。80.75.212 这一段连续占了五六个名次,后面会看到它们不是攻击者本身,而是上游在做多级代理中转。

再看 Top Target Hosts。patentoto.com、forum.phuongnamedu.vn、www.spora.ws、lptlc.org、relaxmacau.com……这些不是什么高价值目标,甚至根本不像"目标",更像是被当作"跳板中转站"或者"SEO 外链反链"的对象。这个现象在后面的凭据分析里会解释清楚。User-Agent 也很有意思:最多的是 Chrome 117 (Windows 10),其次就是 Python/3.12 python-socks/2.3.0、curl/7.68.0、Go-http-client/1.1——典型的"人 + 爬虫脚本"混合负载,脚本流量的占比远高于一般公网流量的平均水平。

三、流量实时画像:Events 看板

因为大部分走的是 HTTPS 流量,所以我们没法看到请求里的 URL、Body 这些明文,只能从 CONNECT 建立隧道时带的 Host 字段,以及 TLS ClientHello 里的 SNI 去做反推。这已经足够了——在"谁、在什么时候、连了哪里、持续了多久、上下行多少"这个粒度上,SNI 就是最稳定的身份指纹。

图:原始事件流:以 SOCKS5 CONNECT 为主,同一源 IP 在毫秒级别内连续敲同一个目标

这一屏是原始事件流。注意时间列:同一个源 IP 150.230.59.207 在一秒之内连续发起了二十多次到 www.aperitiustafaner.com:443 的 SOCKS5 CONNECT,每次 180~240ms 左右。这个节奏不是人工,是脚本在高并发刷一个固定目标。中间穿插了几条不同的目标(abgxefe.com.tr、www.jomdonate.com、imap.t-online.de:993、checkip.amazonaws.com、ntx360.net),说明它在批量任务中顺便回查自己的出口 IP 以及打 IMAP。

图:事件聚合视图:按源 IP × 目标 Host 做二维聚合,直接看出长连接与隧道模式

第二张图是聚合视图,把原始事件按 (Source IP, Host) 二元组折叠起来,一眼就能看出谁在建长连接、谁是短连接喷枪。比如 185.65.244.220 → 185.65.245.140,21,960 次连接、88.8KB 流量、平均 1,216ms,这种模式就是在做代理级联的健康探活。而 213.108.196.9 → smesitel-online.ru,59 次连接、1.3MB、平均 54 秒,这明显是一个爬虫在抓整站。82.193.114.148 发出去的 10 秒超时连接大片出现——这 IP 在扫一批开放的 CONNECT 隧道出口。

四、明文凭据截获:WordPress 黑产的"日常作业"

对于走 HTTP 明文的那部分流量,我们可以直接从请求体里解析出敏感字段,比如 email、password、login、token 这些。结果出乎意料——在所有截获的凭据里,真正意义的"撞库"反倒不是最多的,最多的是 WordPress 的 SEO 黑产。

图:凭据页面:高频出现的 /wp-comments-post.php,攻击者在做 SEO 外链灌水

重点看 URL 那一列——几乎全是 /wp-comments-post.php。这是 WordPress 默认的评论提交接口。攻击者用大量 Gmail 账号(Felicity655、Hilda604、Elliott2591……)往不同的 WordPress 站点批量 POST 评论,评论内容里夹带 SEO 反链。这种玩法在黑灰产圈子里叫"外链养站"或"友链轰炸",目的是把他们操控的赌博站、盗版站、色情站的排名刷上去。这不是一次性的攻击事件,而是他们每天在做的"正经生意"。

为什么这些流量会出现在我们的代理蜜罐里?因为 WordPress 的评论接口本身没有 HTTPS 强制要求(很多小站是 HTTP 裸奔的),而攻击者为了规避 IP 封禁必须要用代理。结果就是:代理这一层变成了黑产 SEO 流水线的中转站,我们拿到了整条流水线里的账号池、目标站列表和节奏。

五、多维度行为分析

把聚合数据按不同维度切开,能看到更多平时盯着单条日志看不出来的模式。这一节放六个维度:爬虫、扫描、撞库、密码高频泄露站点、高价值目标、数据库端口。

5.1 爬虫维度:高请求量来源 IP

把源 IP 按总请求数排序,过滤掉 requests < 1000 的长尾,能看到一个有趣的分层:

图:按 requests 降序,unique_targets 这一列反映了"是爬虫"还是"打固定目标"

45.194.92.15:326 万请求,但只打 27 个目标——固定目标爆破或采集。

130.12.183.13:301 万请求,3,087 个目标——宽面爬虫,几乎每个请求换一个目标。

163.172.69.3:74.6 万请求,515,536 个目标——典型的海量扫描,这个 IP 后面还会反复出现。

62.210.123.69:70.8 万请求,494,318 个目标——和上面一条一个套路。

80.75.212.*:多条记录集中在一两个 unique_ua、unique_nodes=7,说明是一个同一个主体用同一个客户端在同时打 7 个蜜罐节点。

最后那一点值得展开说一下。80.75.212 这个 /24 的多个 IP 都打满了我们所有的节点,而且客户端指纹只有 1~2 种,这不是攻击者在用这个段做出口,而是有人把我们的蜜罐加进了他们的"代理池列表",然后按池轮询地转发他们自己的上游流量。换句话说,我们的蜜罐在他们眼里就是一批"免费好代理"。这个正是蜜罐真正想抓的东西。

5.2 扫描维度:单 IP 命中大量不同 host

图:unique_hosts > 50 的 IP 列表,反映扫描面与扫描策略

扫描维度的查询条件把 unique_hosts 的阈值放到了 50,直接过滤掉那些只打固定目标的。结果出现的第一名还是 163.172.69.3,命中 51.5 万个不同的 host,这在五天窗口里意味着平均每秒要碰 1.2 个新目标——这显然是 URL 列表喂出来的批量扫描,不是漫游式的全网探测。

sample_hosts 那一列提供了很多直接信息:第三名 193.70.47.237 打的是 IP 直连类目标(37.187.133.177:51、79.85.190:70、10.164.178:154.202.109.134 这种),说明它拿到的是一份开放服务的 IP:Port 列表。再往下的多条 IP(107.173.18.15、181.214.218.217、107.173.18.21……)unique_hosts 都精准地停在 1504 或 1454,这个"魔法数字"反复出现,意味着这些 IP 在共享同一份扫描清单。换句话说,背后可能是同一个扫描框架(或同一个 C2)在驱动多台主机。

5.3 账号密码维度:被代理的撞库流量

图:按 (username, password) 聚合的撞库尝试,每组都是 3 次,典型的撞库库特征

这张图非常直接地展示了"撞库"这件事。查询把 username 和 password 都非空、且尝试次数 > 1 的记录拉出来按 attempts 排序,结果是——绝大多数 (user, pass) 组合都正好是 3 次。这个"3 次"不是巧合,是典型撞库库的默认重试阈值;账号全是 Gmail,密码都是常见的个人习惯密码(Fischkopf1!、Jilan1995!、Malcolm!231、Neeraj@07、Gabby1044_1…),说明这批数据不是新鲜 leak,而是经过多轮清洗后的"万能库"。攻击者不是在尝试爆破,是在尝试验证这批老库还有哪些账号还活着。

5.4 密码高频泄露站点:谁在"送"账号

图:按泄露主机聚合的排行,megatypers.com 独占鳌头

换一个角度,我们按"凭据是从哪个 host 的请求里流出来的"来排序,结果第一名 www.megatypers.com 一骑绝尘:14,937 次泄露,涉及 13,007 个不同用户。这个站是做打码平台的——也就是所谓的"验证码人工识别平台",工作者登录进去接单识别别人发来的验证码赚钱。攻击者把成千上万个打码工账号的明文凭据扔给我们的代理,本质上是在用蜜罐帮他们维护账号可用性。

后面几名(suzukatsu.com、bobilreiser.no、marketingevendite.it……)的泄露量都是 20 上下,且 unique_users 基本等于 leaks,这是"每个账号只登过一次"的 fresh 提交模式,更像普通用户或者小规模撞库命中。

5.5 高价值目标 host:金融、加密货币、云、政府

图:关键词过滤 bank/pay/wallet/crypto/exchange/binance/coinbase/metamask/gov/aws/azure/aliyun/tencentcloud 等

给 SQL 加一堆 host ILIKE 关键字,把和支付、加密货币、交易所、云、政府有关的目标专门拉出来。结果出现了几个值得盯的:

pay.tbibank.bg:保加利亚 TBI Bank 的支付接口,4.6 万次访问,4 个独立 IP,上行 140MB。这种量级的上行不像是爬,像是在自动化测试支付表单或者拿着卡头批量试扣款。

pay.ktusa.to:域名就可疑(.to 后缀常见于灰色支付通道),1.35 万次访问。

catexchange.ru、crypto-sparen.com、coldexchanger.com、m.freewallet.org、auth.expo2025-wallet.com:一整条加密货币服务路径——交易所 + 冷钱包 + 热钱包 + 事件相关钓鱼域名(expo2025 是在蹭大阪世博会热度)。

checkip.amazonaws.com:11,239 次,45 个独立 IP。这是所有工具都爱用的"查自己出口 IP"的接口,量大说明很多攻击链路会在每次动作前先校验出口干净。

ajax.googleapis.com 上面出现了 232 个独立 IP——这个是注入框架依赖 jQuery 的常见行为,反映出大量基于 jQuery 的扫描/注入工具在跑。

*.gov.my、*.gov.br、staffs.sch.uk——马来西亚政府域、巴西小政府域、英国学校域都出现了几次,量不大但定向性很强。

5.6 数据库端口穿透

图:port IN (3306, 5432, 1433, 27017, 6379, 9200, 11211) 的 CONNECT 隧道

把 CONNECT 目标的端口限定为数据库端口(MySQL/PostgreSQL/MSSQL/Mongo/Redis/Elasticsearch/Memcached)之后,立刻就看到了一个"专业户":54.37.252.234。这个 IP 在短时间内用我们代理连了几十个 3306 目标,每个目标几百到上千次,节奏很稳——这不是在探测"是否开放",是在对已知开放的 MySQL 做暴力登录。107.173.18.15 单挑 185.126.183.116:3306 1,463 次也是同一个套路。79.127.175.75 同时在 3306 和 5432 上打同一批目标,说明工具支持两种协议。

值得注意的是 Redis(6379)、Mongo(27017)、Elasticsearch(9200)这几个端口的活跃度远低于 MySQL。一个合理解释是:6379/27017/9200 这些服务本身大多放在内网,而 3306 在中小企业里直接暴露公网的比例还很高,对攻击者来说性价比最好。

六、海外对大陆的威胁观察

节点都在海外,所以这个视角其实非常关键:我们能看到海外攻击者(或挂了海外代理的攻击者)在"打进大陆"之前的那一跳。三个子维度:顶级域访问、宽面 SNI 扫描、针对金融行业。

6.1 访问中国国家/地区顶级域

图:SNI 命中 .cn / .com.cn / .net.cn / .org.cn

这几个目标很可疑:xwkf.zidikm.cn、wwa.qzdwlm.cn、fe.dtyuedan.cn——域名都是随机字符串的短拼音,TLD 是 .cn,但任何正常业务都不会用这种域名。更重要的是 down_bytes:xwkf.zidikm.cn 下行 630MB,query.zidikm.cn 下行 288MB。下行流量远大于上行,说明代理这头在"拉取"内容——典型的数据窃取或者配置下发通道。www.gov.cn 这个出现 63 次、1 个独立 IP 的记录量虽然小,但访问源只有一个 IP 反复触达,属于定向探测。

6.2 对国内主流服务的 SNI 扫描

图:SNI 命中 .cn、alibaba、tencent、baidu、huawei、bytedance、weixin、jd、taobao 的源 IP 排行

这张图说的是:单一攻击者在一次会话里,触碰了多少个中国主流服务的子域。172.96.14.120 在短时间内触达了 511 个不同的中国目标 SNI,sample_targets 几乎全是 360.cn、huawei.com、ucloud.cn 的子域,而且子域前缀是随机字符串(sabhlsxzkmfkdrip.ucloud.cn、huyumesciruqwdo.360.cn……)——这是标准的 CDN / WAF 侧面枚举(subdomain enumeration),通过 DNS Wildcard 命中和随机子域探测来反推 CDN 背后真实 IP 的一种手段。64.94.95.226、109.238.10.141 的模式完全相同,说明不是孤例。

6.3 针对国内金融/证券/虚拟货币

图:SNI 命中 eastmoney/10jqka/jrj/cninfo/sse/szse/chinabond/citics 等金融域

quote.eastmoney.com、push2his.eastmoney.com、push2.eastmoney.com、40.push2.eastmoney.com、40.push2delay.eastmoney.com——这几个都是东方财富网的实时行情 WebSocket/推送接口。攻击者通过我们的代理在高频拉取这些接口数据。basic.10jqka.com.cn 是同花顺的数据接口。这些目标组合在一起,指向的用途很明确:行情数据 scraping,喂给量化策略或者做信息套利。这类行为在法律上有争议,但从威胁情报角度看是"低烈度但高频率"的对国内金融业的数据抓取压力。

七、综合分析:出海黑产的日常画像

7.1 反向出网:代理不是去外网,是"回国内人出海"

图:SNI 命中 Google、Facebook、Instagram、YouTube、Twitter、Telegram、Discord、Whatsapp、Reddit 等

一个常被忽略的观察:把流量 SNI 限定为被墙的主流境外服务,会发现这部分流量的量级非常大——i.instagram.com 7.5 万次、www.instagram.com 7.4 万次、www.google.com 4 万次、chromewebstore.google.com 1.3 万次、youtube.com 超过 18GB 下行。这些流量不是"攻击",但它们的使用者很大概率是国内用户在用我们的代理去"反向出网"。

另外几个 SNI 也很有意思:cabinet.aironeox.com、api.galaxy.orionx.com、developer.x.com、query-x.com——这些是加密货币交易所和 X 开发者平台的 API,上下行都以 GB 为单位,属于 API 密集型调用,可能是在自动化交易或者在做 X API 抓推文。

7.2 AI 服务访问:新一代生产工具已经进入黑产工具链

图:对 OpenAI / Anthropic / Google AI / Perplexity / HuggingFace 相关域的访问排行

这一张图值得单独拎出来讲。五天之内,通过我们代理访问 chatgpt.com 的次数 14,856 次,上下行合计 6.22GB;ws.chatgpt.com(WebSocket)4,591 次、2.62GB;claude.ai 2,842 次、1.67GB;gemini.google.com 1,825 次。这个数据透露出三件事:

AI 服务已经深度嵌入黑灰产工作流——不只是 API,连 web 端的 chatgpt.com 都在被高频使用,说明这是"人在操作"而不是纯自动化。

大量访问走的是 web 版而不是 API 版——这多半是因为被封号后换号成本低,或者他们本身就没有付费账号,在用免费层。

能在代理里看到 AI 请求本身,也意味着攻击者"自己被看"。以后安全团队完全可以通过这类数据反向刻画攻击者的工作习惯(生成时间、提问频率、在哪些任务上用 AI)。

7.3 代码托管与开发工具

图:SNI 命中 github / gitlab / bitbucket / docker / npm / pypi / stackoverflow

github.com 192 次、15 个独立 IP,api.github.com 22 次,raw.githubusercontent.com 20 次——量不大,但 raw 内容请求这个动作特别值得关注,因为它通常对应"从 GitHub 拉取恶意脚本 / 配置文件"的行为(比如 raw.githubusercontent.com/xxx/xxx/main/config.json 这种路径在 Stealer、挖矿脚本里非常常见)。release-assets.githubusercontent.com 出现 3 次,对应的是直接下载 GitHub Release 产物——攻击者从 GitHub 上拉打包好的恶意工具。

stackoverflow 出现 11 次——纯靠这个数据说不了什么,但可以看出攻击者确实会在操作过程中搜问题;配合前面的 AI 访问数据,能拼出一个"用户在工作时开着 ChatGPT 和 Stack Overflow"的画像。

7.4 多级代理:代理里面还是代理

图:CONNECT 目标端口是常见代理端口(1080/8080/3128/8443/9050/10808…)的情况

这张图能清楚看到"多层代理"这件事。我们自己的节点(80.75.212.63 等)向 92.242.166.215:8080 发起了几十万次 CONNECT——也就是说,有人把我们的蜜罐接进了一个代理池,然后把我们当作中转再转发到下一跳 92.242.166.215:8080。93.123.85.39 通过我们打到 [::ffff:45.13.239.151]:8080——IPv4-mapped IPv6 地址说明上游客户端是一个支持双栈的 Go 程序。54.37.252.234 就是前面讲过的 MySQL 暴破专业户,这里又出现在 8080、3128、1080 上——它的流量链是"攻击者 → 自己租的 VPS(54.37.252.234)→ 免费代理(我们的蜜罐)→ 一批 8080 代理 → 真正的 3306 目标"。攻击者至少做了 4 跳代理来混淆。

这个对威胁狩猎非常重要:当你在自己网段的日志里看到一个海外 IP 访问你的 MySQL,实际的攻击者可能在 4 跳代理之外;常规的 IP 黑名单几乎没用,真正有效的是行为特征(同样的登录序列、同样的工具指纹、同样的节奏)。

八、从威胁狩猎视角做一次总结

如果把上面这些观察折叠到威胁狩猎(Threat Hunting)的语境里,大致能抽出下面这些可落地的 Hunting 思路。每一条都可以在企业日志里写成对应的检测规则。

(1)以"代理行为"本身作为 IOC

传统 IOC 是 IP / 域名 / 文件哈希。但免费代理的 IP 几乎每小时都在变,用 IP 当 IOC 效率太低。更稳定的特征是"代理行为":同一个 SIP 在短时间内触达大量不同的 dst Host、请求的 Host 和 TLS SNI 不一致、CONNECT 目标是常见代理端口(1080/8080/3128/10808)、User-Agent 是 Go-http-client 或 python-socks 但访问的是 Web 业务域。这些行为组合起来比单个 IOC 稳定得多。

(2)针对 WordPress 黑产的专项监控

这个数据告诉我们,如果你的防御资产里有 WordPress 站,POST /wp-comments-post.php 这个接口长期会被大量 Gmail 账号刷。规则可以写成:同一 IP/UA 在 10 分钟内对 /wp-comments-post.php 的 POST 超过 3 次 → 直接返回 403 或者掉进 tar pit。更彻底的做法是把 wp-comments-post.php 直接换成一个其他路径,或者引入一个轻量 PoW。

(3)撞库特征:魔法数字 3

绝大多数"万能库"验证的默认策略是每组 (user, pass) 重试 3 次。如果你在登录日志里看到同一个账号在不同 IP 上恰好失败 3 次就不再出现,这几乎 100% 是撞库检测的踪迹——账号密码已经进了某个库里,只是这轮没命中。运营侧可以据此推送"强制改密"。

(4)MySQL 公网暴露 = 头号风险

在我们看到的所有数据库爆破里,3306 占绝对主力。任何把 MySQL 直接暴露在公网的业务系统,都应当假设其正在被至少一个黑产工具链瞄准。Hunting 规则:在公网接口上收 3306 的入向 SYN,配合 mysql_native_password 的 Handshake 特征做计数,短时间内超过阈值的源一定是自动化。

(5)CDN 后源 IP 的反查压力

这次看到大量针对 *.huawei.com、*.ucloud.cn、*.360.cn 的随机子域枚举,说明大量 CDN/WAF 服务的"绕过真实 IP"对抗压力仍在增加。Hunting 规则:监控权威 DNS 的 NXDOMAIN 命中率,同一源短时间内大量 NXDOMAIN 通常就是子域爆破。

(6)金融行情类数据的 scraping

东方财富、同花顺这类行情接口的高频抓取现状值得企业自查:WebSocket 连接从同一 IP 保持数十个以上,就已经不是正常用户行为了。

(7)通过代理行为反向画像攻击者

最后一条,也是最有意思的一条:蜜罐记录的 AI 访问、GitHub 访问、Stack Overflow 访问,其实是在记录"攻击者的工作生活"。一个攻击者在早上 9 点开始登 ChatGPT、中午去 GitHub 下载工具、下午开始扫 MySQL、晚上跑撞库——这个时间轴本身就是一个极强的指纹。两个表面上完全无关的攻击活动,如果工作时间轴高度重合、用的 AI 帐号都是同一批、拉取的 Github Repo 都相同——基本可以判定是同一拨人。

九、后续可拓展方向

项目现在跑了五天,已经有一些有意思的洞察,但数据体量和视角都还不够。后面能继续做的事情主要有以下几个方向。

9.1 节点与地理覆盖

目前七个节点都在海外,缺少国内、缺少中东、缺少南美视角。如果能在合规的前提下把节点扩到 20+ 个地区,尤其是补齐东南亚、俄语区、中东,会看到一些目前看不到的攻击人群(比如俄语区黑产习惯走国内云服务,中东对中国制造企业的定向扫描)。

9.2 TLS 指纹与客户端识别

当前只解析了 SNI,还没把 JA3/JA4 指纹做进去。接入 JA3/JA4 以后可以直接按指纹聚合"同一个工具的所有 IP",对追踪工具链的归属非常有用。目前已经能看到 python-socks、Go-http-client 这样的粗粒度分类,如果能细到"某个版本的 sqlmap"、"某个 fork 的 Nuclei",狩猎精度会上一个台阶。

9.3 对请求体的主动注入实验

后台看板里已经有了 Injection 这个入口——如果把它用起来,可以做一件很有价值的事:对特定类别的出口请求(比如 MySQL 爆破流量、登录撞库流量)注入定制响应或者错误码,反过来观察攻击端的重试策略。这既能拿到工具指纹,也能把工具逼到异常分支把更多特征暴露出来。

9.4 把数据做成情报订阅

蜜罐产出的 IOC 天然有时效性(代理 IP 可能今天是攻击者、明天就干净了),但组合 IOC(IP + UA + JA3 + 行为指纹 + 时段)有相对长的半衰期。可以沿着这个思路把数据加工成 STIX 2.1 格式的情报流,对接到企业的 SIEM / SOAR,给防御方多一层视角。对国内金融行业的那部分数据尤其有情报价值。

9.5 AI 使用画像

上文提到过,AI 访问数据里藏着"攻击者怎么工作"的信号。下一步可以专门做一个 AI 流量画像:按小时粒度聚合 ChatGPT/Claude/Gemini 的访问模式,比对攻击事件的时间分布,尝试做"攻击活动 - AI 辅助"的相关性分析。如果能证明"某个 APT 组织每天下午用 ChatGPT 写漏洞扫描脚本"这样的结论,那就是非常有价值的 TTP 级情报。

9.6 多级代理追溯

目前我们能看到"有人把蜜罐接入了代理池",但还没有机制去主动 fingerprint 那个代理池本身。一种可行做法是在响应里注入一个唯一标识(cookie、ETag、响应头),观察这个标识出现在哪些其他蜜罐的下一跳里,从而把整个代理网络的拓扑画出来。

十、最后几句话

免费代理是攻击者成本最低的那一层基础设施——它便宜、匿名、随用随扔。但反过来,它也是防御方观察攻击者最"干净"的那一层:攻击者为了追求匿名,反而把自己的工具链、节奏、账号池、目标列表一股脑儿地暴露在了代理这一跳。五天、七个节点、三千八百万事件,其实只是起了个头——如果把这个观察窗口稳定拉长到三个月、覆盖更多地区,能看到的东西远不止本文这些。

写这篇文章的初衷也很简单:把那些"只在日志里出现过一次的数字"拼成一张能看懂的画。具体的防御规则和情报怎么用,留给对应场景的同行自己判断。数据就在那里。

— 基于 Proxy Honeypot 的观察笔记

跳转微信打开