全球最强大的流量、可见度和市场数据集。已融入您的 AI 助手中。
将 Semrush MCP 连接到 AI
统一 SEO 权威和 AI 可见度的领先平台。
Try Semrush One for free
Discover how leading brands get found and chosen in AI answers.
2026 年 10 月 13 日英国伦敦
Get your ticket now
知识库
Semrush 工具箱
SEO
网站检测
配置网站检测

配置网站检测

当您在 Semrush 中创建第一个项目时,系统会自动为您提供的域名配置并启动网站检测。 初始抓取完成后,您可以在网站检测的侧边栏或 首页查看结果。

对于您创建的任何后续项目,您需要手动配置网站检测。 在网站检测中创建一个新项目,并按照提示配置和启动您的检测营销活动。

如果您的网站检测未运行,请参阅网站检测故障排除。

常规设置

设置向导的第一步是 常规设置。 在这里,点击开始检测即可使用默认设置运行检测,或先自定义您的检测设置。 您可以随时更改设置并重新运行检测,以抓取网站中更具体的区域。
配置网站检测 image 1

范围

要抓取特定的域名、子域名或子文件夹,请将其输入范围字段。 如果您输入的是域名,还可以选择抓取所有子域名复选框。

默认情况下,网站检测会抓取根域名,包括您网站的所有可用子域名和子文件夹。 要限制抓取范围,请将子域名或子文件夹指定为抓取范围,并清除抓取所有子域名复选框。

例如,若只想对您的博客进行检测,请将抓取范围设置为 blog.semrush.com 或 semrush.com/blog/,具体取决于博客采用子域名还是子文件夹形式。
配置网站检测 image 2

每次检测的限额

接下来,在每次检测的限制字段中输入每次检测要抓取的页面数量。 请根据您的订阅以及重新检测网站的频率来确定此数量。

  • 使用 Pro SEO 工具箱检测时,您每月最多可抓取 100,000 个页面,每次最多可抓取 20,000 个页面
  • 使用 Guru SEO 工具箱检测时,您每月最多可抓取 300,000 个页面,每次最多可抓取 20,000 个页面
  • 使用 Business SEO 工具箱检测时,您每月最多可抓取 100 万个页面,每次最多可抓取 100,000 个页面

需抓取的页面数量

抓取的页面设置决定了 SiteAuditBot 如何查找要检测的页面。 除了设置抓取来源外,您还可以在允许/禁止规则和 URL 参数规则步骤中包含或排除特定的子文件夹和 URL 参数。

共有 4 个抓取来源:网站、robots.txt 站点地图、按 URL 的站点地图和从文件导入 URL。

  • 网站:网站检测使用 广度优先搜索算法抓取您的网站,依次遍历页面代码中的链接——从首页开始。 这样会找到最容易从首页访问的页面,但这些页面不一定是最重要的页面。 如果您希望按重要性优先排序,请改用站点地图作为抓取来源。
  • robots.txt 站点地图:网站检测只会抓取 robots.txt 文件中链接的站点地图里找到的 URL
  • 按 URL 的站点地图:网站检测会抓取您指定的站点地图。 直接输入站点地图 URL,而不是依赖 robots.txt 文件中的链接。 网站检测一次只使用 1 个站点地图 URL——如果您的网站有多个站点地图,请改用从文件导入 URL。
  • 从文件导入 URL:网站检测会抓取您上传的一组特定页面。 将文件格式设置为 .csv 或 .txt,每行 1 个 URL,然后从您的电脑上传。 使用此选项检查特定页面并节省抓取预算。 上传后,向导会显示它检测到的 URL 数量,方便您确认文件已正确读取。

配置网站检测 image 3

排期

选择网站检测自动检测网站的频率:

  • 每周(可选择一周中的任意一天)
  • 每日
  • 一次

您可以随时重新运行检测。

配置网站检测 image 4

配置好设置后,点击开始检测。

高级设置和配置

设置向导的第 2 到第 5 步是可选的。 使用这些步骤来控制哪个用户代理抓取您的网站、抓取速度、要包含哪些子文件夹和 URL 参数,以及如何访问受限制的页面。 如果默认设置符合您的需求,请跳过此步骤,直接开始检测。

用户代理

在这里,您可以选择网站检测用于抓取您网站的用户代理。 您的选项有 SiteAuditBot(桌面版)、SiteAuditBot(移动设备版)和 OpenAI-Search——使用 OpenAI-Search 可检查您的网站是否可被 OpenAI 的搜索爬虫抓取。

默认情况下,网站检测使用 SiteAuditBot(移动版)抓取,会以谷歌的移动爬虫查看网站的方式来检测您的网站。 您可以随时切换为 SiteAuditBot(桌面版)。
配置网站检测 image 5

更改用户代理时,字段下方的字符串会相应更新。 您可以将此字符串复制到 cURL 请求中,自行测试用户代理。

抓取延迟

设置抓取延迟有 3 种选项:最小值、每 2 秒 1 个 URL 以及遵循 robots.txt。

最小值:SiteAuditBot 以正常速度抓取,抓取下一页前等待约 1 秒。 这是默认且最快的选项。

每 2 秒 1 个 URL:SiteAuditBot 会减速到每 2 秒抓取 1 个 URL。 如果抓取会拖慢您的网站,且您在 robots.txt 文件中没有抓取延迟指令,请使用此选项。 您的检测完成时间会更长,但在抓取期间会给访客造成更少的速度问题。

遵循 robots.txt:SiteAuditBot 会遵循 robots.txt 文件中指定的抓取延迟。 抓取延迟如下所示:

Crawl-delay: 20

JS 渲染:

开启此项后,SiteAuditBot 将执行您的 JavaScript 文件,并查看与访客相同的内容。 这样可以让您的抓取结果更准确,也能更清楚地了解网站的健康状况。

关闭 JS 渲染后,网站检测只读取您的 HTML——对网站来说更快、负担更轻,但在 JavaScript 密集型页面上的准确性较低。

配置网站检测 image 6

注:只有 Guru 或 Business SEO 工具箱订阅才可使用 JS 渲染。

允许/禁止规则

使用此步骤可抓取或阻止特定子文件夹。 您可以一次指定多个子文件夹。

输入顶级域名(TLD)之后的所有 URL 内容。 例如,要抓取 http://www.example.com/shoes/mens/,请在允许子文件夹中输入 /shoes/mens/。
配置网站检测 image 7

要跳过某个子文件夹,请在不允许子文件夹中输入其路径。 例如,要抓取男鞋分类但跳过 https://example.com/shoes/mens/hiking-boots/ 下的徒步靴分类,请在不允许子文件夹中输入 /shoes/mens/hiking-boots/。
配置网站检测 image 8

重要:请包含末尾斜杠。 如果您输入 /shoes 而不是 /shoes/,网站检测会跳过 /shoes/ 子文件夹中的所有内容,并且跳过所有以 /shoes 开头的 URL,例如 www.example.com/shoes-men。

URL 参数规则

URL 参数也称为查询字符串,是 URL 中不属于层级路径结构的元素。 它们会附加到 URL 末尾,并向网页浏览器传递指令。

一个 URL 参数由 ?、参数名称和 = 组成。 例如,?page=3 可能表示分页序列中的第三页。

使用 URL 参数规则步骤指定网站使用的参数,这样网站检测在抓取时会从 URL 中将这些参数去除。 否则,当爬虫遇到页面的 2 个版本(一个带参数,一个不带参数)时,可能会同时抓取两者并浪费您的抓取预算。

请在要忽略的参数中输入每个参数。

配置网站检测 image 9

例如,输入 page 会去除该参数的所有值——?page=1、?page=2,依此类推。 然后,网站检测会将 /shoes 和 /shoes/?page=1 视为同一个 URL,并只抓取该页面一次。

常见参数包括分页、语言和子分类。 这些情况在拥有大量产品或内容目录的网站上尤为常见。 UTM 参数用于跟踪营销活动中的点击量和流量,这也是另一种常见情况。

要更改现有营销活动中的这些设置,请打开设置齿轮并选择检测设置,然后调整上面说明的相同选项。

配置网站检测 image 10

绕过的限制

要检测预发布环境中或通过基本访问身份验证隐藏的网站,您有 3 个选项。

配置网站检测 image 11

绕过 robots.txt 和 robots 元标签中的禁止规则

将 Semrush 提供的 .txt 文件上传到您网站的根文件夹。 这可以验证您的所有权,并允许 SiteAuditBot 抓取因 robots.txt 文件中的 disallow 指令或页面中的 robots 元标签而被阻止的页面 区域中的 robots 元标签所屏蔽的页面。

使用我的凭证抓取

输入您用于访问网站隐藏部分的用户名和密码。 SiteAuditBot 会使用这些凭据访问受密码保护的区域。 建议用于非公开网站和正在开发中的网站。

使用 Web Bot Auth 签名抓取

某些托管平台,例如 Shopify,出于安全或性能原因,默认会阻止未知机器人。 Web Bot Auth 签名可让 SiteAuditBot 表明身份,并证明其有权访问您的网站。 配置方法:

  1. 选择使用 Web Bot Auth 签名抓取复选框
  2. 在 Signature Agent 中,输入代理 URL,例如 https://shopify.com
  3. 在签名输入中,输入您的主机要求的输入字符串
  4. 在签名中,输入您的平台提供的加密签名

疑难解答

如果您看到检测域名失败错误,您的服务器很可能正在阻止 SiteAuditBot。 按照网站检测故障排除步骤将该机器人加入允许列表。

您还可以下载抓取失败时生成的日志文件,并将其发送给您的网站管理员,由其用来确定 SiteAuditBot 被阻止的原因。

连接 Google Analytics(分析)和网站检测

完成设置向导后,您可以连接您的 Google Analytics(分析)账户,以发现影响浏览量最高页面的问题。

常见问题

不。 在抓取器设置中的用户代理下拉菜单里,已不再提供 Googlebot 桌面版和移动版。 您的选项有 SiteAuditBot(桌面版)、SiteAuditBot(移动版)和 OpenAI-Search。 设置为 Googlebot 的现有营销活动会一直用其进行抓取,直到您更改用户代理为止。