AI 搜索爬虫与内容访问政策
公开兰塞 AI 对搜索、AI 引用、用户触发访问、训练爬虫与异常自动访问的当前规则。
截至 2026-07-18,兰塞 AI 允许合规搜索引擎、AI 搜索/引用系统、用户触发访问工具和其他遵守 robots.txt 的爬虫访问公开、可索引页面。后台、站内搜索、作者归档和查询型重复 URL 被限制。允许访问不保证收录、排名或 AI 引用,也不表示本站授予转载、再分发、去除署名或其他超出页面与素材许可的权利。
本政策覆盖哪些自动访问
本政策适用于通过 HTTP(S) 自动请求本站公开页面的搜索爬虫、AI 搜索与引用爬虫、用户触发的网页读取工具、模型开发爬虫、监测工具和其他自动客户端。登录后台、未公开草稿、私有工单、服务器文件、数据库和绕过访问控制的行为不属于公开抓取范围。
爬虫名称、用途和运营方可能变化;本站以当前公开的 `robots.txt`、页面 robots、HTTP 状态和必要的服务器安全策略为实际控制信号。
当前 robots.txt 规则快照
User-agent: * 当前规则适用于所有没有单独分组的自动客户端。
Disallow `/wp-admin/`、`/search/`、`/author/`、`/*?s=`、`/*?replytocom=`。
Allow `/wp-admin/admin-ajax.php`,用于公开页面所需的合法异步请求。
Sitemap `https://aichatqa.com/sitemap.xml`。
AI 专用段 当前没有针对 OAI、GPTBot、Claude、Perplexity 或 Bytespider 的单独禁止规则。
规则快照用于解释,不替代根目录实时文件;自动系统应直接读取 robots.txt。
抓取用途必须分开理解
| 用途 | 典型动作 | 当前公开访问态度 | 不能据此推断 |
|---|---|---|---|
| 传统搜索索引 | 发现、抓取、索引并在搜索结果展示链接 | 允许访问公开可索引页面 | 不保证收录、排名或摘要形式 |
| AI 搜索与引用 | 为答案检索、建立搜索索引或生成引用链接 | 允许访问公开可索引页面 | 不保证被选择、准确引用或完整呈现边界 |
| 用户触发访问 | 用户要求工具打开、总结或检查某个 URL | 允许访问公开页面并遵守同一路径限制 | 不允许绕过登录、付费、验证码或私有数据 |
| 模型开发或训练抓取 | 收集公开网页用于模型开发数据 | 当前 robots.txt 未设置专门禁用段 | 抓取许可不等于版权、商标、隐私或再分发许可 |
| 其他自动化 | 监测、归档、批量采集或代理请求 | 须遵守公开范围、合理频率和安全限制 | 未知 UA 或伪装 UA 不获得额外权限 |
常见爬虫应按公开用途和实时规则判断
| 示例 User-Agent | 公开说明中的主要用途 | 本站当前状态 | 复核方式 |
|---|---|---|---|
| Googlebot、bingbot | 传统搜索发现与索引 | 公开页面允许 | 官方 UA/IP 文档、服务器日志和抓取工具 |
| OAI-SearchBot | OpenAI 搜索能力 | 公开页面允许 | OpenAI 官方爬虫文档与当前 robots.txt |
| GPTBot | OpenAI 模型开发相关抓取 | 当前未单独禁止 | OpenAI 官方用途说明;与搜索 UA 分开判断 |
| ChatGPT-User | 用户触发的网页访问 | 公开页面允许 | 请求日志、官方说明;不等同持续索引 |
| Claude-SearchBot、Claude-User、ClaudeBot | 搜索、用户触发和模型开发为不同用途 | 当前均未单独禁止 | Anthropic 官方说明与实时规则 |
| PerplexityBot、Perplexity-User | 搜索索引与用户请求访问 | 公开页面允许 | Perplexity 官方爬虫文档与 IP/UA 信息 |
| Bytespider | 日志中识别到的字节系自动爬虫 UA | 当前未单独禁止 | 服务器日志、反向/正向 DNS 或运营方公开信息;UA 字符串本身不证明身份 |
访问控制不是只有 robots.txt 一层
- robots.txt:给合规爬虫提供路径级抓取偏好,公开且可缓存。
- 页面 robots:`index,follow`、`noindex` 等控制具体页面的索引意图;普通标签现为 index,follow。
- HTTP 与 canonical:200、301、404、410 和 canonical 表达页面状态与首选 URL。
- sitemap 与 llms.txt:帮助发现公开、重要或适合机器理解的页面,不替代质量判断。
- 认证与权限:私有内容必须由登录和权限保护,不能只依赖 robots.txt。
- 服务器安全:异常频率、伪装、攻击或资源耗尽可被限速、挑战或阻断。
允许引用,但要求保留来源与上下文
- 优先链接具体原文 URL,而不是只写站名或复制无来源摘要。
- 保留标题、发布日期/复核日期和会影响结论的适用范围。
- 不得把本站编辑判断改写成厂商官方声明,也不得删除“不保证、仅适用、截至某日”等边界。
- 短摘要用于帮助用户决定是否访问原文;大段复制、重建全文库或去除来源不属于普通引用。
- 图片、截图、代码和第三方素材按各自许可处理,页面可抓取不改变素材权利。
详细规则见来源、引用与图片授权政策和编辑与内容核验规范。
更新、删除与缓存需要重新发现
实质修改会更新页面复核状态;删除或合并使用 301、404 或 410 等合适状态,并同步 sitemap、`llms.txt` 和 IndexNow。搜索或 AI 系统可能保留缓存,本站只能更新源页面和提交发现信号,不能保证第三方立即刷新。相关问题可通过纠错与内容更新提交。
自动访问应保持合理频率
爬虫应缓存 robots.txt,避免短时间重复抓取同一 URL,支持压缩与条件请求,并在 429、503 或 Retry-After 出现时退避。批量下载、并发过高、无视缓存、制造大量参数 URL 或持续请求不存在路径,可能触发自动限流。我们不会因为某 UA 声称属于知名公司就免除安全检查。
禁止绕过公开边界和造成服务不可用
- 绕过登录、验证码、权限检查或其他访问控制读取非公开内容。
- 抓取后台、私有纠错工单、个人信息、密钥、数据库或服务器文件。
- 伪造知名爬虫 UA、来源 IP 或身份以逃避限速和安全策略。
- 利用参数、重试或并发造成资源耗尽,或继续请求明确禁止的路径。
- 把可访问页面当作复制、出售、训练、再许可或去除署名的自动授权证明。
策略会怎样调整
本站可能根据服务器负载、内容权利、滥用情况、爬虫用途变化或运营方透明度,对特定 UA、路径或频率增加允许、延迟或禁止规则。任何重大变更都应先核对运营方最新官方文档,并同步本页日期与实际 robots.txt,不能让政策页与机器信号矛盾。
查看抓取、引用与数据边界的相关内容
下方案例覆盖训练数据记忆、抓取诉讼、AI 搜索引用、知识库删除和豆包核验。仅展示仍处于 A/B 认证状态的页面。
官方依据与复核说明
robots 基础规则参考 Google Search Central robots.txt 指南;AI 用途区分参考 OpenAI Crawlers、Anthropic Bots和 Perplexity Crawlers。本页由兰塞 AI 编辑部于 2026-07-18 对照线上 robots.txt 复核。
发现异常抓取、错误引用或需要核对的缓存内容,可通过纠错工单提供 URL、UA、时间、请求路径和非敏感日志片段。