Robots Meta 标签生成器
开发根据 index/noindex/follow/noarchive 等指令拼装 <meta name="robots"> 标签与 X-Robots-Tag 头。
本页内容
什么是 robots meta 指令?#
robots meta 指令告诉搜索引擎爬虫:可以对一个页面做什么——是否收录、是否跟踪其中的链接、是否保留缓存副本、是否在结果里显示摘要等等。它是页面级别的那个”杠杆”,适用于这种场景:某个 URL 必须保持公开(一个预发布页、一个致谢页、一份法律 PDF),但又不该出现在 Google 结果里;或者你想反过来塑造搜索结果里那条摘要的样子。
指令可以放在两个地方。robots meta 标签位于页面 HTML 的 <head> 里,只作用于这一份 HTML 文档。X-Robots-Tag HTTP 响应头则跟随响应本身发出,适用于服务器返回的任何东西——PDF、图片、视频、JSON 文件——尤其是那些根本没有 <head> 可以塞标签的资源。搜索引擎两种都认;本工具用同一组开关同时生成两种形式,你需要哪种就直接复制。
最该记住的一条规则是:不写指令就等于”不限制”。 一个完全不带 robots 标签的页面,会被按 index, follow 处理——完全可以被抓取收录。本工具产出的指令,都是叠加在这个默认值之上的”可选限制”。Google 参考文档定义了那一套标准指令集,这里的开关与之逐一对应。
如何使用#
- 勾选左侧 Options(选项)里的复选框。前两个是特殊的——默认勾选:
- index / follow——取消勾选会输出
noindex/nofollow。 - noarchive——禁止 Google 显示”网页快照”链接。
- nosnippet——抑制结果下方的文字摘要。
- noimageindex——不让本页图片被作为引用页索引。
- notranslate——拒绝结果里”翻译此页”的提议。
- noodp——遗留项;忽略已废弃的 DMOZ/ODP 标题。
- nositelinkssearchbox——抑制站内链接搜索框。
- index / follow——取消勾选会输出
- 可选:在 unavailable_after 下选一个日期时间——页面在那个时刻之后会从搜索结果中移除。适合给促销或限时文档”自动过期”。
- 读取右侧的两份输出:
- Meta tag(meta 标签)——完整的
<meta name="robots" content="...">元素,可直接粘进<head>。 - X-Robots-Tag——HTTP 头形式,可加到服务器或 CDN 的响应配置里。
- Meta tag(meta 标签)——完整的
- 在任一输出旁边点击 Copy(复制)取走。
主要特性#
- 一源两形。 meta 标签和
X-Robots-Tag头同时生成,HTML 页面和非 HTML 资源(PDF、图片)能拿到同一条指令。 - 感知默认值。
index和follow默认勾选,与真实 Web 上”不声明即不限制”的默认行为一致。 - 完整标准指令集。 覆盖 Google 文档里每一条指令——
noindex、nofollow、noarchive、nosnippet、noimageindex、notranslate、noodp、nositelinkssearchbox、unavailable_after。 - 支持
unavailable_after。 这是唯一带取值的指令;会被组装成unavailable_after: <日期>并逐字透传,格式由你掌控。 - 100% 客户端运行。 没有配置要上传、没有服务端要往返——生成、复制,然后自己在 CMS、模板或 nginx 配置里应用。
实战示例#
保持默认(只勾 index 和 follow),两份输出都是:
<meta name="robots" content="index, follow">
X-Robots-Tag: index, follow
这就是”不限制”的显式写法——当你想刻意声明某页可被完全抓取时很有用。
接着取消勾选 index(让一个致谢页不被收录,同时仍让它页面上的链接把权重传出去),输出变成:
<meta name="robots" content="noindex, follow">
X-Robots-Tag: noindex, follow
第三种情况:一个季节性活动落地页,活动结束后要自动消失。保持 index 和 follow 勾选,把 unavailable_after 设到活动结束时间,标签就变成:
<meta name="robots" content="index, follow, unavailable_after: 2025-12-31T00:00">
到那个时间戳之后,Google 就不再展示该页。日期取值会按你选择的格式原样输出,所以请确认它符合目标搜索引擎所接受的日期格式。
常见问题#
meta 标签里的 noindex 和在 robots.txt 里 disallow 有什么区别?#
它们工作在不同层面,绝不能随意混用。noindex 是爬虫抓取页面之后才会读到的指令。如果你在 robots.txt 里封了该 URL,爬虫根本不会抓取,也就看不到 noindex,却仍可能基于指向该页的链接把它索引进去。要稳定地把一个页面挡在索引之外,正确做法是:允许抓取,但加上 noindex——不要把页面完全对爬虫藏起来。
什么时候该用 X-Robots-Tag 头而不是 meta 标签?#
只要资源不是 HTML 就要用头——PDF、图片、视频、表格这些没有 <head> 可以塞 meta 标签的东西,响应头是唯一选择。它也适合通过服务器或 CDN 配置一次性给一大批文件套同一条规则,而不用逐个改文档。
noindex, follow 还会传递链接权重吗?#
会。noindex 控制的是页面是否出现在结果里;follow 控制的是爬虫是否跟踪页面上的链接。noindex, follow 让页面不进索引,但页面外链的权重依然能流过去。这正是致谢页、站内搜索结果、分面筛选页的标准配方。
既然 index, follow 是默认值,为什么这个工具还输出它?#
因为”显式声明”本身有时有用:它在源码里记录了意图、可以覆盖继承到的更严格规则、某些团队也把”标签存在”视为”此页已被评审”的信号。如果你更想依赖隐式默认,那直接不写标签即可——完全不写和 index, follow 是等价的。