GPTMap

避免 thin content:AI 主题长文的厚度下限与自检命令

为什么你的文章'已发现但未编入索引'?大概率是 thin content。本文给出 AI 主题长文的五条厚度下限、结构模板,以及三条可直接复制的自检命令。

TL;DR
thin content(内容稀薄页)是 Google '已发现但未编入索引' 状态的最常见根因:页面被抓取但不进索引,流量为零。本文给出 AI 主题长文的五条厚度下限——正文 ≥2000 字、H2 ≥5、教程文代码块 ≥3(注明语言)、对比文表格 ≥1、FAQ ≥5 条——以及 <main> 纯文本字数统计、H2 计数等可复制的自检命令。核心原则:字数不是目标,信息密度才是;表格是 AI 摘要引擎最常引用的形式,首段直接定义是 GEO 的第一抓手。
thin content(内容稀薄页)指对用户缺乏独立价值的页面——内容过短、模板化、缺少结构化信息(无表格、无代码、无数据)。Google 通常将其排除在索引之外(GSC 中表现为'已发现-尚未编入索引'),AI 摘要引擎也会降低对它的引用优先级。

操作步骤

  1. 构建站点

    pnpm build 生成最终 HTML——自检的对象是构建产物而非 Markdown 源文件,导航与页脚的字数不会计入。

  2. 统计 main 纯文本字数

    用第 3 节的 python 命令统计 <main> 内纯文本字数,确认 ≥2000;不足先补真实内容,而不是拉长句子。

  3. 统计 H2 与结构化元素

    grep 统计 H2 数量(≥5);教程文再查注明语言的代码块(≥3),对比文查表格行(≥1)。

  4. 不达标不提交

    任何一项低于下限,回到正文补数据、案例与对比,重建后重跑本流程,全过再进入发布清单。

thin content(内容稀薄页)指对用户缺乏独立价值的页面——内容过短、模板化、缺少结构化信息。它是 Google Search Console 里"已发现-尚未编入索引"状态的最常见根因:页面被 Googlebot 发现并抓取,但因为价值不足被排除在索引之外,表现为零曝光、零流量。本文给出 GPTMap 编辑部在 AI 主题长文上使用的厚度下限与结构标准,以及三条可直接复制的自检命令——写完一篇文章、准备发布之前,先跑一遍。

1. thin content 是什么,Google 怎么处理它

Google 的官方立场是不给"对用户缺乏独立价值"的页面排名。Search Essentials 与"创建实用、可靠、以用户为中心的内容"指南给出的判断维度包括:内容是否有原创信息与洞察、是否有明确的主题聚焦、是否由懂行的人创作、页面是否主要为了搜索引擎而非读者而拼凑。

thin content 在实践中有三种典型形态:

  • 过短:千字以内、只把问题复述了一遍就结束。
  • 模板化:每个 H2 下都是"明确目标:先定义完成的标准"这类占位句子——字数够了,信息量为零。
  • 聚合空壳:只有链接列表、没有摘要与对比的标签页 / 目录页。

Google 的处理不是罚款而是降权:这些页面通常停在"已发现-尚未编入索引"或"已抓取-尚未编入索引"状态。这个状态的危险之处在于它不报错——文章看起来正常发布了,只是永远没有流量。

2. 五条厚度下限

GPTMap 编辑部在发布清单里执行的下限如下。它们不是 Google 的官方数字(Google 从不公布阈值),而是从真实翻车案例里提炼的经验值:

维度下限说明
<main> 纯文本字数≥ 2000 字用第 3 节的命令统计,别用全文 HTML 字数(导航和页脚会虚增)
H2 数量≥ 5一篇文章至少要有五个真正展开的小节
代码块(教程 / 技术文)≥ 3,且注明语言每个围栏开头紧跟语言名(如 python、typescript)
表格(对比 / 选型文)≥ 1对比文没有表格基本等于没写
FAQ≥ 5 条同时进正文 FAQ 区和 FAQPage 结构化数据

两条使用说明:第一,这些下限是"不达标大概率翻车"的门槛,不是"达标必然收录"的保证——内容质量永远在阈值之上;第二,不同文种侧重不同,教程文盯代码块、对比文盯表格,但字数与 H2 是所有文种的公共下限。

3. 如何自检:三条可复制命令

构建产物是最终真相——检查构建出来的 HTML,而不是 Markdown 源文件。

统计 <main> 纯文本字数(先 pnpm build,把 <slug> 换成文章 slug):

python3 -c "import re; h=open('apps/web/.next/server/app/zh/posts/<slug>.html',encoding='utf-8').read(); t=re.sub(r'<script[\s\S]*?</script>','',h); t=re.sub(r'<style[\s\S]*?</style>','',t); m=re.search(r'<main[^>]*>(.*?)</main>',t,re.S); print(len(re.sub(r'\s+',' ',re.sub(r'<[^>]+>',' ',m.group(1))).strip()))"

这条命令剥掉 script 与 style,只取 <main> 内的文本,再压缩空白后计数。之所以不用全文 HTML:导航、页脚、侧栏的字数会制造达标假象。

统计 H2 数量(对 Markdown 源文件):

grep -c '^## ' apps/web/content/posts/<slug>.zh.md

统计注明语言的代码块与表格行(教程文看前者,对比文看后者):

grep -c '^```[a-z]' apps/web/content/posts/<slug>.zh.md
grep -c '^\|' apps/web/content/posts/<slug>.zh.md

四条命令全部过线再提交。任何一条不达标,回去补内容——补真实的数据、案例和对比,而不是把句子拉长。

4. 结构模板:定义 → 分节 → 表格 → FAQ

4.1 首段直接定义(GEO 第一抓手)

第一段必须包含"X 是……"的直接定义,与 frontmatter 的 definition 字段互相呼应。AI 摘要引擎(ChatGPT、Perplexity 及各类 AI 搜索)在组织回答时,优先从文章开头搬运结构化定义句。一个可被原样搬走的定义,比三段铺垫更有引用价值。

4.2 对比文:表格是 AI 最爱的形式

对比、选型类文章必须用 markdown 表格承载核心结论:模型名、价格、上下文长度、适用场景各占一列。表格对 AI 引擎的意义在于结构对齐——它可以整行整列地引用而不需要重新组织语言。同时给表格配上"怎么选"的决策段落,让表格有解读、不是孤数据。

4.3 教程文:step 化 + howTo 结构化数据

教程类文章把操作拆成明确的步骤序列,并在 frontmatter 里加 howTo 字段(name + description + steps,每步 name + text)。前端会渲染 HowTo JSON-LD,这是 Google 富结果里步骤展示的入口。代码块逐个注明语言,命令行示例给出预期输出。

4.4 FAQ:自问自答覆盖长尾

把用户真实会问的问题写进 frontmatter 的 faqs(≥5 条),正文里再以"常见问题"区完整呈现一遍。FAQ 覆盖的是搜索长尾与 AI 对话里的追问场景——很多用户的问题不会精确命中标题,但会精确命中 FAQ。

5. 三个常见反模式

占位文字充字数。"明确目标:先定义完成的标准""注意验证结果"这类句子在任何主题下都成立,因此不构成信息增量。自检方法很简单:逐节问"删掉这节,读者损失了什么?"答不上来就删或重写。

聚合空壳页。标签页、目录页如果只有链接列表,就是典型的 thin 页型。要么给每条被聚合的内容写一句独立摘要并提供筛选逻辑,要么 noindex。GPTMap 的频道页之所以能收录,是因为每个频道有独立的 summary、topics 与文章计数,而不是裸列表。

与站内已有文章高度同质。同一主题写第三篇时,如果核心结论与既有文章重合度过高,Google 可能只收录其中一篇,其余进入"重复内容"判定。解法不是 noindex,而是给新文章一个真正不同的切面——不同受众、不同深度、不同决策场景——并在文间互相内链。

6. 与 GEO 的关系:双重惩罚

thin content 在 AI 搜索时代的代价是双份的。搜索引擎侧是前面说的不收录;AI 摘要引擎侧则更隐蔽:即使页面被索引,稀薄的内容也提取不出可搬运的结构化片段——没有表格可引、没有定义可搬、没有数字可复述——于是永远不会出现在 AI 的回答里。反过来,一篇厚度达标、结构清晰的文章,同一份内容同时服务 SEO 与 GEO:这就是 /llms.txt 这类面向 LLM 的内容标准的出发点——把结构化、可引用当作一等公民。

常见问题

1. 文章多少字才不算 thin content?

没有官方数字门槛。经验下限是 <main> 纯文本 2000 字 + H2 ≥5 + 至少一种结构化元素(表格 / 代码 / 数据)。但要记住:字数不是目标,信息密度才是——2000 字模板化占位文一样会被判 thin content。

2. 为什么我的文章在 GSC 显示"已发现但未编入索引"?

最常见根因是 thin content:内容过短、模板化、无独立价值。先用本文的自检命令量一下 <main> 字数与 H2 数量;如果达标,再排查是否与站内已有文章高度重复(内部 canonical 冲突),或页面是否被 robots 间接限制。

3. AI 摘要引擎也会惩罚 thin content 吗?

会,而且更直接。ChatGPT / Perplexity 引用内容时偏好结构化、可搬运的片段:带数字的表格、直接定义、分点结论。稀薄页面即使被收录,也几乎不会被 AI 引用——在 thin content 这件事上 SEO 与 GEO 是同向的。

4. 代码块必须注明语言吗?

必须。三个反引号后紧跟语言名(python、typescript 这样)是标准写法——它既是可访问性要求,也是 Google 富结果与 AI 引擎正确理解代码的前提。裸围栏在部分渲染器里不会高亮,也不会被当作代码识别。

5. 更新旧文章能解除 thin content 判定吗?

能,但前提是实质增量:补真实数据、表格、可运行的案例,而不是改几个词刷新日期。更新后同步修改 frontmatter 的 updatedAt,并在 GSC 对该 URL 重新请求编入索引。

6. 标签页、聚合页是不是天然 thin?

是高风险页型。聚合页必须提供额外价值(每条的摘要、可比较的列、筛选逻辑)才值得收录;否则建议 noindex,或者把聚合页的信息并进一篇真正的长文。

下一步

关键要点

  • Google 对 thin content 的典型处理是'已发现-尚未编入索引'——页面被抓取但不进索引,GSC 里表现为零曝光
  • 五条厚度下限:正文 ≥2000 字 / H2 ≥5 / 教程文代码块 ≥3 / 对比文表格 ≥1 / FAQ ≥5
  • 对比文必须用 markdown 表格——表格是 AI 摘要引擎最常引用的形式
  • 首段直接定义('X 是…')是 GEO 第一抓手——AI 引擎优先从这里搬结构化句子
  • 模板化占位文字也计入字数但对 Google 无价值——每个 H2 下必须有真实信息增量
  • 自检用 <main> 纯文本字数而非全文字数——导航、页脚的字数会虚增达标假象

常见问题

没有官方数字门槛。经验下限是 <main> 纯文本 2000 字 + H2 ≥5 + 至少一种结构化元素(表格 / 代码 / 数据)。但要记住:字数不是目标,信息密度才是——2000 字模板化占位文一样会被判 thin content。

官方参考

相关文章

订阅 GPTMap Weekly

每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。

GPTMap Editorial发布于 2026-08-29 13 分钟阅读
测试环境(EEAT)
最后测试时间:2026-08-29
使用模型:gpt-5.6