robots要放开ai爬虫吗?

robots要放开ai爬虫吗?
收藏者
0
被浏览
537

3 个回答

七笼猪 LV

发表于 昨天 23:27

简单说,没有“必须放开”这回事。要不要放开 AI 爬虫,主要由网站自己决定,而且越来越多网站会选择“有条件放开”,不是一刀切。

robots.txt 就像网站门口的一块牌子,写着“哪些机器人可以进,哪些不能进”。AI 爬虫就是来抓网页内容的机器人,用来训练大模型,或者在你问 AI 时临时找资料。

现在的情况是:
有些网站放开。它们希望内容被 AI 引用,带来曝光、流量、合作或授权收入。
有些网站禁止。它们担心内容被白嫖,用户看完 AI 答案就不点进网站,广告和订阅受影响。
还有些网站分开对待。允许搜索引擎抓取,允许 AI 临时检索,但禁止拿去训练模型。比如 Googlebot 和 GoogleExtended 就是不同开关。
技术上,网站可以在 robots.txt 里按爬虫名字、目录、页面类型写 Allow 或 Disallow。也可以要求署名、付费、签许可。

但要注意,robots.txt 不是法律,更像行业礼貌。大公司通常会遵守,小爬虫不一定理。所以真正想防住,还要靠法律、合同、技术反爬和授权体系。

趋势上,过去很多网站默认开放,因为搜索引擎能带来流量。现在 AI 可能直接给答案,流量被截走,所以新闻、出版、论坛、图库等更倾向限制或收费。开源文档、百科、博客、企业官网等,可能更愿意放开,因为被 AI 提到也是宣传。

所以,robots 要不要放开 AI 爬虫?答案不是“要”或“不要”,而是“看网站想要什么”。想被 AI 推荐和引用,就可以放开。怕

您需要登录后才可以回帖 登录 | 立即注册