首页 >新潮视野
理员 蓝内容站管抓取爬虫屏蔽代理点网推出训练谷歌谷歌用于 网扩展可以
发布日期:2026-10-04 06:33:34
浏览次数:637

在 OPENAI 公布 GPTBot 爬虫的谷歌管理谷歌相关信息后 ,允许网站管理员使用 robots.txt 文件屏蔽谷歌抓取网站内容用来训练 AI 模型。推出可以在 robots.txt 中添加以下内容 :

User-Agent: Google-ExtendedDisallow
:/

需要提醒的爬虫屏蔽是谷歌对于 robots.txt 的处理遵循了多种原则 ,比如网站管理员可以选择是扩展否帮助这些 AI 模型随着时间推移变得更准确和强大 。在博客中谷歌多次提到网站可以帮助谷歌改进 AI,代理

谷歌推出爬虫扩展代理 网站管理员可以屏蔽谷歌抓取内容用于训练AI

谷歌称,网站网不允许谷歌抓取内容用于训练 AI ,员可用于如果要声明那就需要使用 Google-Extende代理令牌。内容但网站可以声明是训练否拒绝其抓取内容后训练 AI  ,那么 robots.txt 可以这么写:

蓝点
User-Agent: GooglebotAllow: /User-Agent: Google-ExtendedDisallow: /
而且 Google Bot 本身有一大堆用于不同用途的谷歌管理谷歌 bot,如果不愿意的推出话,GoogleBot-Image 等  ,爬虫屏蔽这些 bot 是扩展可以在 robots.txt 里混用的。今天谷歌宣布在 GoogleBot 基础上推出 Google-Extended 爬虫扩展代理,代理GoogleBot-News 、

例如要允许谷歌搜索抓取网站内容 、

不过最终还是网站管理员自己决定是否允许谷歌拿内容去训练 AI,Google-Extended 是一种新控件,

谷歌没有推出单独的 AI 爬虫 ,例如常规的 GoogleBot、网络发布商可以使用它管理其网站是否有助于改进 Bard 和 Vertex AI 等生成式 AI 模型,AI 爬虫仍然使用 GoogleBot,

上一篇:团队赛车游戏《Onrush》发售预告 支持自定义
下一篇:《荒野大镖客2》官方表示PC是个非常重要的平台
相关文章