Linux内核基础设施遭到AI爬虫持续轰炸 即便部署反爬措施也会被AI绕过
2026-8-31 06:30:13 Author: www.landian.news(查看原文) 阅读量:18 收藏

#行业资讯 Linux 内核基础设施遭到 AI 爬虫持续轰炸,即便部署反爬措施现在也会被 AI 爬虫绕过。Linux 基金会 IT 基础设施负责人兼内核设施管理员里亚比采夫日前透露内核基础设施遭到持续轰炸,每天 600 万次请求里只有 2% 是正常访问。即便现在已经部署 Anubis 工作量证明验证机制,AI 爬虫也可以继续绕过。查看全文:https://ourl.co/126543

Linux Foundation IT 基础设施负责人兼内核设施管理员康斯坦丁・里亚比采夫近日公布 git.kernel.org 的实际流量数据,直言 AI 时代的网络爬虫已经成为长期基础设施负担。

需要说明的是这并非 Linux 基金会发布的官方政策声明,而是负责 IT 基础设施的管理员基于服务器数据给出的观察,目前 Linux 基金会还未说明要禁止 AI 爬虫抓取内容或实施其他政策。

目前内核 Git 每天约收到 600 万次随机提交页面请求,其中 66% 的请求会被 Anubis 工作量证明验证机制拦截,该验证机制会在访问者设备上进行少量 CPU 计算以证实这是真实人类访问,不过目前已经有 33% 的请求可以完成验证继续访问。

里亚比采夫估算,即便采用比较宽松的判断标准,真正的正常访问可能也只有 2%。在分布于 5 个节点的 90 个 CPU 核心中,长期有 14~16 个核心专门用于把 Git 提交渲染为 HTML 供这些爬虫抓取,这消耗大约 20% 的算力,消耗甚至超过 Git 克隆等其他正常访问。

Linux内核基础设施遭到AI爬虫持续轰炸 即便部署反爬措施也会被AI绕过

里亚比采夫称 Linux 内核仓库天然适合训练模型:历史代码和提交记录公开,并且大量内容产生于生成式 AI 普及前,因此这些内容可以作为相对干净的训练语料。

问题在于数据本来可以直接通过 Git 高效克隆,但部分爬虫选择逐个请求 cgit 生成的 HTML 页面。Linux 内核主仓库约有 148 万个提交,但 git.kernel.org 还有约 922 个相关分支仓库,同一批 Git 对象由此可以组合出数十亿甚至更多有效的 URL,大量重复抓取反而将渲染压力全部留给服务器。

早期爬虫还会暴露 UA 或集中使用云服务器 IP,管理员可以通过 fail2ban、封锁 IP 地址或 IP 所属的 ASN 自治网络来实施高效封禁。后来流量开始大量来自住宅 IP 和移动网络 IP 代理,每个地址仅请求数次后便消失。

同时爬虫伪装为普通浏览器,里亚比采夫认为这与代理 SDK 变现网络有关,此前三星和 LG 电视都会被发现有大量第三方应用内含代理 SDK,将用户网络变成代理 IP 走流量。

随后里亚比采夫部署 Anubis 验证机制,要求访问者完成工作量证明,最初这确实有效果,但现在爬虫逐渐可以完成难度 4 甚至 5 的验证,而继续提高难度又会让手机等正常用户等待更久并增加计算负担,所以也无法继续提高难度。

目前 Linux 基础设施并未被这些流量压垮,但管理员已经准备减少可抓取的 URL、关闭部分高成本功能、对匿名访问增加限制等。真正的问题并非公开数据抓取,而是爬虫利用效率极低的方式反复消耗开放源码社区有限的基础设施资源,最终代价可能由所有正常用户共同承担。


消息源:Kernel.org

热门推荐仅需99元/年,硅谷CN2GIA服务器,另有3年版仅需528元,限量销售,售完即止

  • 微软终于不再强推Windows 11 OneDrive备份功能 现在用户可以设置不再弹窗提醒

  • 近期大量甲骨文云(OCI)账号被盗 盗号源头已经被NS网友扒出 现在在归还机器

  • 英伟达将在10月发布适用于Windows 10的最终版显卡驱动 之后停止功能更新

  • Claude Code宣布从9月起为用户永久增加25%周额度 但实际上是缩减17%

  • Codex发布更新修复多个导致用量消耗过多的问题 另今夜或明天将再次重置

  • 购买域名高价出售也可能属于恶意:阿里巴巴通过仲裁拿回Alibaba.ai域名


文章来源: https://www.landian.news/archives/126543.html
如有侵权请联系:admin#unsafe.sh