
不少企业官网做了很多年SEO,在AI问答里却一次都没被提到。原因通常不复杂,往往卡在几个很基础的地方。下面九项不需要任何工具,用浏览器就能查完,大概半小时。
一、AI爬虫能不能抓
在浏览器地址栏输入你的域名,后面加 /robots.txt。看这个文件里有没有出现 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 这些名字,以及它们是被允许还是被禁止。
需要特别注意 Google-Extended。它控制内容能否用于Gemini的训练与引用,并且不受 User-agent: * 那一段的约束。文件里没写它,等于默认不授权。
二、有没有canonical
随便打开一个内页,右键查看网页源代码,搜索 canonical。每个页面都应该有一行 link rel="canonical",指向这个页面自己的唯一网址。
没有canonical,而站点又能通过带www和不带www两个地址打开,那就是同一份内容有两个地址。搜索引擎会判定重复,AI抓取端会困惑该引用哪一个。
三、有没有sitemap.xml
域名后面加 /sitemap.xml。应该能看到一份XML清单,列出站点全部页面。
清单里的网址必须和页面里canonical写的完全一致,包括结尾有没有斜杠。两边不一致等于对同一个页面申报了两个地址。
四、每页标题是不是唯一的
把几个内页的标题栏文字抄下来对比。如果多个页面标题相同,或者都是"公司名-主营业务"这种通用后缀占了大半,那么这些页面在机器眼里几乎没有区分度。
标题控制在六十个字符以内,前面放这一页真正在讲的东西,品牌名放后面。
五、每页是不是只有一个H1
查看源代码,搜索 h1。数量应该是一。
很多模板会在页面横幅里放一个栏目名当H1,正文标题再来一个,于是一页两个H1。机器无法判断哪个才是这一页的主题。
六、有没有结构化数据
查看源代码,搜索 application/ld+json。应该能看到一段JSON。
文章页尤其要检查里面有没有 datePublished。缺时间的内容在时效性判断上直接出局——用户问"2026年怎么做",模型不会引用一篇它无法确定年份的文章。
七、内容是不是在回答问题
打开三篇主要内容页,只读小标题。把这些小标题连起来看,能不能拼出一串用户真会问的问题?
如果小标题是"产品优势""服务体系""我们的价值",那是在自我描述。如果是"发稿平台怎么选""大概多少钱""多久能看到效果",那是在回答问题。只有后者能被直接切出来当答案。
八、有没有FAQ区块
九、有没有可核验的具体信息
通读一篇主要内容,数一数里面有多少个具体数字、时间、地点、步骤、条件。
一篇通篇形容词的文章,模型无法从中提取任何事实,也就无从引用。具体信息越多,被采信的概率越高。
常见问题
这九项里最该先做哪一项?
第一项和第二项。抓取授权和canonical属于地基,这两项不对,后面做得再好也传不出去。它们通常也是改起来最快的。
自查发现问题,必须找服务商吗?
不一定。标题、H1、FAQ这几项,只要网站后台能编辑内容就可以自己改。robots.txt、canonical、结构化数据涉及模板文件,一般需要技术支持,但工作量通常按小时算,不是大工程。
查完都没问题,还是搜不到怎么办?
那说明基础层没问题,问题在内容本身的可引用性和外部印证上。前者看第七到第九项,后者需要在其他可信来源上出现相同信息,让模型有交叉验证的依据。


