记录 Gitea 服务器遭 Anthropic 爬虫狂轰滥炸与排查处理经历

1
2
3
4
5
6
7
8
9
10
11
12
    _          _   _                     _      
/ \ _ __ | |_| |__ _ __ ___ _ __ (_) ___
/ _ \ | '_ \| __| '_ \| '__/ _ \| '_ \| |/ __|
/ ___ \| | | | |_| | | | | | (_) | |_) | | (__
/_/ \_\_| |_|\__|_| |_|_| \___/| .__/|_|\___|
|_|
_ _ __ __ ____ _
| \ | | \/ / ___|| |
| \| | |\/| \___ \| |
| |\ | | | |___) | |___
|_| \_|_| |_|____/|_____|

原本只是正常早起背单词,结果家里放的小服务器突然风扇狂转、呼啸作响。出于运维糕手的直觉,这显然很不寻常。登上服务器后台一看,CPU 温度和占用率完全不对:(

CPU 温度与占用异常

经过排查,发现是自建的 Gitea 服务占满了系统资源,正在频繁触发各种消耗计算资源的 git diff 和并发数据拉取。我第一时间去问了下 TSSC 超算队的队友,发现当时并没有人在使用或者拉取大仓库。

看样子是遭到了外部爬虫的恶意刷取,不是哥们我们私有服务器你爬来干啥TT。


1. 第一次应对:关闭访客访问

一开始我并没有太放在心上,以为只是某个互联网扫描器扫到了公开端口。于是我直接登录 Gitea 管理后台,将全局访问权限调整为仅限登录用户访问(关闭访客查看功能),以为这样就能轻松把爬虫挡在门外。

Gitea 设置关闭访客访问


2. 极其顽固的“死缠烂打”

然而事情远没有我想象的那么简单。这个爬虫异常顽固!

即便我已经禁用了匿名访问,所有未登录请求都会被强行重定向到登录界面(返回 303 / 登录页),但该爬虫依旧完全不理会重定向,依然在以极高频率不停地发起请求,疯狂刷屏 Gitea 的日志。

Gitea 日志刷新及重定向记录

因为大量 HTTP 请求依然直接打在本地服务器上,处理重定向和连接依然消耗着服务器资源,虽然风扇转速和CPU温度有所下降但是我还是无法忍受。


3. 套 Cloudflare 依然被吸干 46G 流量

意识到单靠 Gitea 内部的权限控制无法解决高并发请求带来的资源消耗后,我便开始和队友商量对策。

我们的 Gitea 服务配置方式是通过我在家里的内网服务器反代到公网的,队友帮我的 Gitea 服务套上了 Cloudflare (CF) 防护,并配置了一些基础规则。本以为有了赛博菩萨出手可以安息了,结果这个扫码的爬虫依然在不间断地骚扰,甚至只是变动了一下源 IP 地址,继续狂刷!

到了问题最终被解决的时候,我查了一下统计数据,这个爬虫居然已经不知不觉啃掉了我 46 GB 的网络流量,下载速度最高的时候达到过近 20MiB/s!

中途截取的网络流量消耗日志

无法原谅!我和队友这才意识到情况不对劲:这绝对不是哪位闲人随意的随机扫描,而是有针对性的持久抓取!


4. 深查源头:居然是沟槽的 Anthropic 在搞鬼

为了搞清楚到底是哪来的出生在狂发请求,我们开始仔细调阅 Cloudflare 的访问日志,并对请求源 IP 进行反向溯源。

结合 Cloudflare 的捕获记录、IP 数据库查询以及通义千问 (Qwen Studio) 的 IP 查询结果:

Cloudflare 访问记录

IP 数据库查询结果

Qwen Studio IP 查询验证

所有指向线索惊人地一致——这个把我们小服务器刷到风扇狂转、吞掉 46G 流量的恶性爬虫,居然来自最不会营销、最清白、最懂安全、最尊重版权、最不会蒸馏、最严于律己宽于待人、最喜欢给用户发福利、最不爱定制榜单、最不喜欢把模型降智给用户限流、最便宜、最喜欢人工维护、最不会全程让AI工作然后出岔子只会甩锅、最不会侵犯用户隐私然后倒打一耙限制蒸馏、最喜欢修bug然后补偿用户损失、最见的别人家好、最喜欢公平竞争、最讨厌装神弄鬼的知名 AI 巨头 Anthropic m(0_0)m

看到这个查询结果的一瞬间,直接把我和队友给气笑了。堂堂A➗爬虫写得如此粗暴无礼,连遇到重定向死循环和验证码拦截都不带停的,活脱脱像个 DDoS 攻击。

A畜是这样的
轻松绷住


5. 彻底拦截与复盘反思

排查出源头后,我们在 Cloudflare 的 WAF 规则中针对来自 Anthropic 的 IP 段和 User-Agent 彻底添加了 Block 封锁规则。

规则生效后,Gitea 的日志终于不再疯狂刷屏,服务器的 CPU 温度也迅速回落,风扇终于安静了下来。

6. 疑问与复盘:私有 Gitea 地址是怎么泄漏的?

问题解决后,我们不禁思考:为什么一个完全私有的、没有在互联网任何公开页面做过外链的家用 Gitea 地址,会被 Anthropic 的爬虫盯上并狂轰滥炸?

熙熙攘攘,我们的TSSC's Gitea

综合推测,基本怀疑是我们在平时使用 Claude Code 进行辅助开发时,工具在读取本地 git config 或拉取/推送上下文时,把我们的私有 Gitea 仓库 URL 作为元数据上报到了 Anthropic 远端。而 Anthropic 的后台抓取系统收到这个 URL 后,便自动化地派出了爬虫进行“大吞噬”,企图把仓库里的代码抓去训练大模型……

如果这个猜想属实,不得不令人警惕:

  1. AI 编程工具的隐私保护:在使用各类 AI 编程助手时,代码仓库地址、内部配置甚至敏感数据都可能在无意间被收集,还是开源工具更加可靠。
  2. AI 爬虫的野蛮生长:大模型厂商在急迫获取训练数据的同时,其爬虫策略往往缺乏对个人开发者或小服务器的对等尊重与流控保护。
  3. Anthropic本质畜生:没话讲了刻板印象再次加深。

希望这次记录能给同样自建 Git 服务或使用 AI 辅助开发的朋友们提醒:一定要关注私有服务的 WAF 防护与敏感 URL 暴露风险!


记录 Gitea 服务器遭 Anthropic 爬虫狂轰滥炸与排查处理经历
http://blog.hifuu.ink/2026/08/03/anthropic-crawler-report/
作者
CGH0S7
发布于
2026年8月3日
许可协议