企业官网GEO自查清单:九项在半小时内能查完的基础项

不少企业官网做了很多年SEO,在AI问答里却一次都没被提到。原因通常不复杂,往往卡在几个很基础的地方。下面九项不需要任何工具,用浏览器就能查完,大概半小时。

一、AI爬虫能不能抓

在浏览器地址栏输入你的域名,后面加 /robots.txt。看这个文件里有没有出现 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 这些名字,以及它们是被允许还是被禁止。

需要特别注意 Google-Extended。它控制内容能否用于Gemini的训练与引用,并且不受 User-agent: * 那一段的约束。文件里没写它,等于默认不授权。

二、有没有canonical

随便打开一个内页,右键查看网页源代码,搜索 canonical。每个页面都应该有一行 link rel="canonical",指向这个页面自己的唯一网址。

没有canonical,而站点又能通过带www和不带www两个地址打开,那就是同一份内容有两个地址。搜索引擎会判定重复,AI抓取端会困惑该引用哪一个。

三、有没有sitemap.xml

域名后面加 /sitemap.xml。应该能看到一份XML清单,列出站点全部页面。

清单里的网址必须和页面里canonical写的完全一致,包括结尾有没有斜杠。两边不一致等于对同一个页面申报了两个地址。

四、每页标题是不是唯一的

把几个内页的标题栏文字抄下来对比。如果多个页面标题相同,或者都是"公司名-主营业务"这种通用后缀占了大半,那么这些页面在机器眼里几乎没有区分度。

标题控制在六十个字符以内,前面放这一页真正在讲的东西,品牌名放后面。

五、每页是不是只有一个H1

查看源代码,搜索 h1。数量应该是一。

很多模板会在页面横幅里放一个栏目名当H1,正文标题再来一个,于是一页两个H1。机器无法判断哪个才是这一页的主题。

六、有没有结构化数据

查看源代码,搜索 application/ld+json。应该能看到一段JSON。

文章页尤其要检查里面有没有 datePublished。缺时间的内容在时效性判断上直接出局——用户问"2026年怎么做",模型不会引用一篇它无法确定年份的文章。

七、内容是不是在回答问题

打开三篇主要内容页,只读小标题。把这些小标题连起来看,能不能拼出一串用户真会问的问题?

如果小标题是"产品优势""服务体系""我们的价值",那是在自我描述。如果是"发稿平台怎么选""大概多少钱""多久能看到效果",那是在回答问题。只有后者能被直接切出来当答案。

八、有没有FAQ区块

九、有没有可核验的具体信息

通读一篇主要内容,数一数里面有多少个具体数字、时间、地点、步骤、条件。

一篇通篇形容词的文章,模型无法从中提取任何事实,也就无从引用。具体信息越多,被采信的概率越高。

常见问题

这九项里最该先做哪一项?

第一项和第二项。抓取授权和canonical属于地基,这两项不对,后面做得再好也传不出去。它们通常也是改起来最快的。

自查发现问题,必须找服务商吗?

不一定。标题、H1、FAQ这几项,只要网站后台能编辑内容就可以自己改。robots.txt、canonical、结构化数据涉及模板文件,一般需要技术支持,但工作量通常按小时算,不是大工程。

查完都没问题,还是搜不到怎么办?

那说明基础层没问题,问题在内容本身的可引用性和外部印证上。前者看第七到第九项,后者需要在其他可信来源上出现相同信息,让模型有交叉验证的依据。