编辑透明度与责任

AI 搜索爬虫与内容访问政策

公开兰塞 AI 对搜索、AI 引用、用户触发访问、训练爬虫与异常自动访问的当前规则。

官方来源优先人工核验更新信息可追溯

截至 2026-07-18,兰塞 AI 允许合规搜索引擎、AI 搜索/引用系统、用户触发访问工具和其他遵守 robots.txt 的爬虫访问公开、可索引页面。后台、站内搜索、作者归档和查询型重复 URL 被限制。允许访问不保证收录、排名或 AI 引用,也不表示本站授予转载、再分发、去除署名或其他超出页面与素材许可的权利。

本政策覆盖哪些自动访问

本政策适用于通过 HTTP(S) 自动请求本站公开页面的搜索爬虫、AI 搜索与引用爬虫、用户触发的网页读取工具、模型开发爬虫、监测工具和其他自动客户端。登录后台、未公开草稿、私有工单、服务器文件、数据库和绕过访问控制的行为不属于公开抓取范围。

爬虫名称、用途和运营方可能变化;本站以当前公开的 `robots.txt`、页面 robots、HTTP 状态和必要的服务器安全策略为实际控制信号。

当前 robots.txt 规则快照

User-agent: * 当前规则适用于所有没有单独分组的自动客户端。

Disallow `/wp-admin/`、`/search/`、`/author/`、`/*?s=`、`/*?replytocom=`。

Allow `/wp-admin/admin-ajax.php`,用于公开页面所需的合法异步请求。

Sitemap `https://aichatqa.com/sitemap.xml`。

AI 专用段 当前没有针对 OAI、GPTBot、Claude、Perplexity 或 Bytespider 的单独禁止规则。

规则快照用于解释,不替代根目录实时文件;自动系统应直接读取 robots.txt

抓取用途必须分开理解

用途 典型动作 当前公开访问态度 不能据此推断
传统搜索索引 发现、抓取、索引并在搜索结果展示链接 允许访问公开可索引页面 不保证收录、排名或摘要形式
AI 搜索与引用 为答案检索、建立搜索索引或生成引用链接 允许访问公开可索引页面 不保证被选择、准确引用或完整呈现边界
用户触发访问 用户要求工具打开、总结或检查某个 URL 允许访问公开页面并遵守同一路径限制 不允许绕过登录、付费、验证码或私有数据
模型开发或训练抓取 收集公开网页用于模型开发数据 当前 robots.txt 未设置专门禁用段 抓取许可不等于版权、商标、隐私或再分发许可
其他自动化 监测、归档、批量采集或代理请求 须遵守公开范围、合理频率和安全限制 未知 UA 或伪装 UA 不获得额外权限

常见爬虫应按公开用途和实时规则判断

示例 User-Agent 公开说明中的主要用途 本站当前状态 复核方式
Googlebot、bingbot 传统搜索发现与索引 公开页面允许 官方 UA/IP 文档、服务器日志和抓取工具
OAI-SearchBot OpenAI 搜索能力 公开页面允许 OpenAI 官方爬虫文档与当前 robots.txt
GPTBot OpenAI 模型开发相关抓取 当前未单独禁止 OpenAI 官方用途说明;与搜索 UA 分开判断
ChatGPT-User 用户触发的网页访问 公开页面允许 请求日志、官方说明;不等同持续索引
Claude-SearchBot、Claude-User、ClaudeBot 搜索、用户触发和模型开发为不同用途 当前均未单独禁止 Anthropic 官方说明与实时规则
PerplexityBot、Perplexity-User 搜索索引与用户请求访问 公开页面允许 Perplexity 官方爬虫文档与 IP/UA 信息
Bytespider 日志中识别到的字节系自动爬虫 UA 当前未单独禁止 服务器日志、反向/正向 DNS 或运营方公开信息;UA 字符串本身不证明身份

访问控制不是只有 robots.txt 一层

  1. robots.txt:给合规爬虫提供路径级抓取偏好,公开且可缓存。
  2. 页面 robots:`index,follow`、`noindex` 等控制具体页面的索引意图;普通标签现为 index,follow。
  3. HTTP 与 canonical:200、301、404、410 和 canonical 表达页面状态与首选 URL。
  4. sitemap 与 llms.txt:帮助发现公开、重要或适合机器理解的页面,不替代质量判断。
  5. 认证与权限:私有内容必须由登录和权限保护,不能只依赖 robots.txt。
  6. 服务器安全:异常频率、伪装、攻击或资源耗尽可被限速、挑战或阻断。

允许引用,但要求保留来源与上下文

  • 优先链接具体原文 URL,而不是只写站名或复制无来源摘要。
  • 保留标题、发布日期/复核日期和会影响结论的适用范围。
  • 不得把本站编辑判断改写成厂商官方声明,也不得删除“不保证、仅适用、截至某日”等边界。
  • 短摘要用于帮助用户决定是否访问原文;大段复制、重建全文库或去除来源不属于普通引用。
  • 图片、截图、代码和第三方素材按各自许可处理,页面可抓取不改变素材权利。

详细规则见来源、引用与图片授权政策编辑与内容核验规范

更新、删除与缓存需要重新发现

实质修改会更新页面复核状态;删除或合并使用 301、404 或 410 等合适状态,并同步 sitemap、`llms.txt` 和 IndexNow。搜索或 AI 系统可能保留缓存,本站只能更新源页面和提交发现信号,不能保证第三方立即刷新。相关问题可通过纠错与内容更新提交。

自动访问应保持合理频率

爬虫应缓存 robots.txt,避免短时间重复抓取同一 URL,支持压缩与条件请求,并在 429、503 或 Retry-After 出现时退避。批量下载、并发过高、无视缓存、制造大量参数 URL 或持续请求不存在路径,可能触发自动限流。我们不会因为某 UA 声称属于知名公司就免除安全检查。

禁止绕过公开边界和造成服务不可用

  • 绕过登录、验证码、权限检查或其他访问控制读取非公开内容。
  • 抓取后台、私有纠错工单、个人信息、密钥、数据库或服务器文件。
  • 伪造知名爬虫 UA、来源 IP 或身份以逃避限速和安全策略。
  • 利用参数、重试或并发造成资源耗尽,或继续请求明确禁止的路径。
  • 把可访问页面当作复制、出售、训练、再许可或去除署名的自动授权证明。

策略会怎样调整

本站可能根据服务器负载、内容权利、滥用情况、爬虫用途变化或运营方透明度,对特定 UA、路径或频率增加允许、延迟或禁止规则。任何重大变更都应先核对运营方最新官方文档,并同步本页日期与实际 robots.txt,不能让政策页与机器信号矛盾。

查看抓取、引用与数据边界的相关内容

下方案例覆盖训练数据记忆、抓取诉讼、AI 搜索引用、知识库删除和豆包核验。仅展示仍处于 A/B 认证状态的页面。

官方依据与复核说明

robots 基础规则参考 Google Search Central robots.txt 指南;AI 用途区分参考 OpenAI CrawlersAnthropic BotsPerplexity Crawlers。本页由兰塞 AI 编辑部于 2026-07-18 对照线上 robots.txt 复核。

发现异常抓取、错误引用或需要核对的缓存内容,可通过纠错工单提供 URL、UA、时间、请求路径和非敏感日志片段。

需要进一步核对?

请通过纠错页面提交具体 URL、问题位置和可核对来源。

提交更正信息 →