一篇内容写得很好,并不意味着搜索引擎一定能够正常发现和收录它。

页面可能被robots.txt挡住,Canonical指向了其他URL,服务器返回错误状态码,正文只能通过JavaScript加载,或者网站生成了大量重复参数页面。对普通访问者来说,这些问题有时并不明显,但对Googlebot来说,它们可能直接影响内容能否进入搜索索引。

技术SEO,也就是Technical SEO,主要处理的就是这一层问题。它并不是研究“文章里应该出现多少次关键词”,而是让网站在技术层面具备被搜索引擎发现、抓取、理解、索引和长期维护的条件。

技术SEO包含哪些内容?从抓取、索引到网站性能完整解析

技术SEO解决什么问题

可以把搜索引擎处理网站的过程简单理解为:

发现URL
↓
抓取页面
↓
渲染内容
↓
理解页面
↓
选择规范URL
↓
建立索引
↓
参与搜索结果

技术SEO要做的,就是尽量保证这条链路没有因为网站自身的技术配置出现障碍。

Google在Search Essentials中列出的最低技术条件其实并不复杂:Googlebot不能被禁止访问,页面应该能够正常工作,并且页面需要包含Google能够索引的内容。

但对于真实网站来说,随着页面数量、筛选参数、JavaScript应用、多语言版本和CMS功能增加,问题会迅速变复杂。因此技术SEO通常包含多个不同模块。

搜索引擎能否抓取

第一步不是“排名怎么样”,而是搜索引擎能不能访问页面。

这里最常见的配置就是:

robots.txt

例如:

User-agent: *
Disallow: /admin/
Disallow: /search/

robots.txt主要用于管理搜索引擎爬虫可以请求哪些URL。后台页面、部分内部搜索结果或没有搜索价值的大量系统路径,可以根据实际情况限制抓取。

但有一个非常常见的误区:robots.txt并不是可靠的“禁止收录工具”。

Google官方明确说明,即使某个URL禁止抓取,如果其他网页仍然链接到这个URL,Google仍有可能知道这个地址并将URL显示在搜索结果中,只是无法正常读取页面内容。

真正希望一个网页不进入Google索引时,更常用的是:

<meta name="robots" content="noindex">

或者通过HTTP响应头设置X-Robots-Tag。

因此技术SEO首先需要分清两个问题:

  • 这个URL要不要让Googlebot访问?

  • 这个URL要不要进入搜索索引?

二者不是同一件事。

页面是否可以被索引

能够抓取并不等于一定能够索引。

一个页面可能正常返回内容,但同时包含:

<meta name="robots" content="noindex">

这种情况下,Google可以访问页面,却会根据指令将页面排除在索引之外。

技术SEO排查时通常需要检查:

  • 页面是否意外存在noindex;

  • HTTP Header中是否返回X-Robots-Tag;

  • 页面是否需要登录才能访问;

  • 正文内容是否实际存在于Google能够处理的页面中;

  • Canonical是否把当前页面指向其他URL;

  • 服务器是否返回正确的HTTP状态码。

特别是在网站从测试环境迁移到正式环境时,很容易发生开发人员保留了测试期间的noindex设置,结果网站上线以后长时间无法正常进入搜索索引。

URL结构是否清晰

技术SEO还需要处理网站URL设计。

例如产品页面可以是:

/products/solar-inverter/

而不是长期依赖:

/index.php?id=98372&type=4&cat=28

这并不是说Google无法处理参数URL,而是稳定、逻辑清晰的URL更方便网站长期管理,也更容易建立明确的内容层级。

URL设计通常需要考虑:

  • 同一页面是否存在多个访问地址;

  • 大小写URL是否产生重复页面;

  • HTTP与HTTPS是否统一;

  • 带不带www是否统一;

  • 尾部斜杠是否形成多个版本;

  • 筛选和排序参数是否产生大量URL;

  • 文章修改标题后是否频繁改变URL。

技术SEO的目标不是把关键词全部塞进URL,而是减少没有必要的URL变体,并保持路径长期稳定。

Canonical如何处理重复页

电商、CMS和参数型网站经常会出现多个URL展示相同或非常接近的内容。

例如:

/product/a/
/product/a/?source=google
/product/a/?sort=price

如果这些地址本质上都是同一产品页面,就需要考虑规范化问题。

常见做法是在页面中加入:

<link rel="canonical" href="https://example.com/product/a/">

Canonical的作用是告诉Google,在一组重复或高度相似的URL中,网站更希望哪个地址作为代表版本。

Google目前把重定向和rel="canonical"视为较强的规范化信号,而Sitemap属于较弱信号。

实际配置时需要保持一致。例如不要出现:

Canonical → URL A
Sitemap → URL B
内部链接 → URL C

这种互相冲突的结构会增加搜索引擎判断规范页面的难度。

内部链接能否发现页面

搜索引擎发现网站内容,很大程度上依赖链接。

一个页面即使已经发布,如果网站中没有任何入口指向它,也没有出现在Sitemap中,就会变成所谓的“孤立页面”。

Google官方建议页面之间使用可以抓取的HTML链接,例如:

<a href="/products/solar-inverter/">光伏逆变器</a>

技术SEO通常会检查:

  • 重要页面能否从导航或栏目页到达;

  • 分页内容有没有正常链接;

  • 面包屑是否形成合理层级;

  • 是否存在大量孤立页面;

  • 是否有链接指向404页面;

  • 内部链接是否长期经过多次跳转。

对于大型网站,合理的网站结构还可以帮助搜索引擎更有效地发现新页面。

Sitemap应该怎么处理

XML Sitemap是技术SEO中非常常见的一项配置。

它的作用不是“提交以后保证收录”,而是向Google提供网站希望被发现的重要URL。

例如:

https://example.com/
https://example.com/products/
https://example.com/products/product-a/
https://example.com/blog/article-a/

Google官方明确说明,提交Sitemap只是一个提示,并不能保证Google一定抓取或索引其中所有URL。

技术SEO更应该关注Sitemap本身是否干净,例如:

  • 只放希望参与搜索的规范URL;

  • 不要长期包含404页面;

  • 不要包含被noindex的页面;

  • 不要同时提交大量重复URL;

  • 重要新页面能够及时进入Sitemap。

单个Sitemap最多包含50000个URL,并且未压缩文件大小不能超过50MB。更大型的网站可以使用多个Sitemap,再通过Sitemap Index进行组织。

状态码和跳转是否正确

HTTP状态码也是技术SEO的基础。

几个最常见的状态包括:

200  页面正常
301  永久重定向
302  临时重定向
404  页面不存在
410  内容已经删除
5xx  服务器错误

例如一个已经删除的产品页面,如果页面上写着“商品不存在”,但服务器依然返回:

200 OK

搜索引擎可能将其判断为Soft 404。

另一个常见问题是重定向链:

URL A
↓ 301
URL B
↓ 301
URL C
↓ 301
URL D

如果网站经过多次改版,内部链接仍然指向最旧地址,就会产生大量没有必要的跳转。

更合理的方式通常是让内部链接直接指向最终URL,并让旧地址尽可能直接跳转到最终页面。

JavaScript内容能否渲染

现代网站大量使用React、Vue、Next.js以及其他JavaScript框架,因此JavaScript SEO已经成为技术SEO的重要组成部分。

Google处理JavaScript页面大致包括:

抓取
↓
渲染
↓
索引

Googlebot能够执行JavaScript,但这并不意味着所有JavaScript架构都不需要考虑SEO。

例如一个页面最初返回:

<div id="app"></div>

所有标题、正文和链接都必须等待浏览器执行JavaScript并调用API之后才出现,那么Google也需要经过渲染过程才能读取这些内容。

技术SEO需要检查:

  • 关闭JavaScript后服务器返回了什么;

  • Google渲染以后能否看到主要正文;

  • 关键链接是否真正生成了href;

  • JavaScript和CSS资源是否被robots.txt阻止;

  • 接口错误时是否产生空白页面;

  • Title、Canonical和robots信息是否正确生成。

Google能够处理客户端渲染,但官方仍然指出,服务器端渲染或预渲染通常是不错的方案,因为它们能够让用户和爬虫更快获得页面内容。

移动端内容是否完整

Google目前使用移动版网站内容进行索引和排名,也就是Mobile-first Indexing。

因此技术SEO不能只检查桌面版。

如果桌面页面包含完整正文,而移动端为了“界面简洁”删除了大量内容,就可能导致Google实际用于理解页面的信息减少。

需要重点确认:

  • 移动端和桌面端主要内容是否一致;

  • Title和Meta信息是否一致;

  • 结构化数据是否完整;

  • 图片是否可以抓取;

  • 移动页面是否正常返回内容;

  • 按钮和导航是否能够正常使用。

对于大多数新网站,响应式设计通常是维护成本相对较低的方案,因为桌面端和移动端可以使用相同URL和HTML结构。

页面性能需要关注什么

网站性能也是技术SEO经常负责的部分。

Google目前的Core Web Vitals主要包含三个指标:

指标关注内容良好参考值
LCP主要内容加载速度2.5秒以内
INP页面交互响应速度200毫秒以内
CLS页面视觉稳定性0.1以内

例如首屏大图没有压缩,可能影响LCP;执行时间很长的JavaScript可能影响INP;图片没有预留尺寸,加载过程中页面不断移动,则可能增加CLS。

常见性能优化包括:

  • 压缩和合理加载图片;

  • 减少阻塞渲染的资源;

  • 降低大型JavaScript执行成本;

  • 使用浏览器缓存;

  • 合理使用CDN;

  • 优化服务器响应时间;

  • 避免页面元素加载后频繁移动。

不过,Core Web Vitals不应该被理解成“分数越高排名就一定越高”。Google明确说明,良好的Core Web Vitals有助于搜索和用户体验,但获得满分并不能保证页面取得靠前排名。

结构化数据有什么作用

结构化数据的作用,是通过标准格式进一步帮助搜索引擎理解页面中的实体和内容类型。

例如:

  • Article;

  • Product;

  • Organization;

  • Breadcrumb;

  • Recipe;

  • JobPosting。

Google推荐使用JSON-LD格式,例如:

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Article",
  "headline": "技术SEO包含哪些内容?"
}
</script>

正确的结构化数据能够帮助页面获得特定的富媒体搜索结果资格,但并不保证Google一定展示Rich Result。

同时,结构化数据必须与用户真正能够看到的页面内容一致。不能页面上没有评分,却通过Schema人为添加五星评价。

多语言网站怎么处理

如果企业网站同时提供中文、英文、日文或不同国家版本,国际化SEO也会进入技术SEO范围。

例如:

/cn/product/
/en/product/
/jp/product/

不同语言页面之间可以通过hreflang帮助Google理解对应关系。

技术上需要处理:

  • 每种语言是否拥有独立URL;

  • hreflang是否互相指向;

  • Canonical是否错误地全部指向一种语言;

  • 语言切换是否依赖Google无法发现的交互;

  • 是否根据IP强制跳转导致爬虫看不到其他版本。

对于国际企业站来说,这类错误有时会导致一个国家版本正常收录,而其他语言版本长期表现异常。

HTTPS和网站安全

HTTPS现在已经是网站基础配置之一。

网站从HTTP迁移HTTPS以后,需要确保:

http://example.com/page/
↓ 301
https://example.com/page/

同时还要更新:

  • Canonical;

  • Sitemap;

  • 内部链接;

  • 结构化数据URL;

  • 图片和资源地址。

否则可能出现页面已经使用HTTPS,但Canonical仍然指向HTTP,或者页面内部继续加载不安全资源的情况。

大型网站还要看抓取效率

并不是每个网站都需要重点研究Crawl Budget,也就是抓取预算。

对于只有几百或几千个正常页面的网站,通常更应该先解决页面质量、内部链接和索引配置。

但如果网站拥有几十万甚至数百万URL,例如大型电商、招聘、分类信息和UGC平台,就需要关注搜索引擎的抓取资源是否浪费在大量低价值URL上。

常见问题包括:

?color=red
?color=blue
?sort=price
?sort=date
?page=2
?session=xxxxx

筛选、排序和参数组合可能生成成千上万个URL。

这时技术SEO需要与开发人员一起控制URL生成逻辑、内部链接以及抓取入口,而不是简单在robots.txt里封掉所有参数。

Search Console如何监控

技术SEO不是网站上线时检查一次就结束。

Google Search Console可以持续观察多个重要问题,例如:

  • 哪些页面已经建立索引;

  • 哪些页面被排除;

  • Google选择了哪个Canonical;

  • Sitemap是否正常读取;

  • 页面是否存在Core Web Vitals问题;

  • 结构化数据是否出现错误;

  • Google抓取某个URL时看到了什么。

其中URL Inspection对于排查单页问题尤其有用。如果一个页面长期不收录,可以先确认Google是否发现了URL、是否抓取成功、是否允许索引以及Google最终选择的Canonical。

技术SEO不是单独一个插件

很多CMS提供SEO插件,可以自动生成Title、Canonical、Sitemap和部分Schema,因此容易让人产生一种印象:安装一个SEO插件以后,技术SEO就完成了。

实际上,插件只能覆盖部分配置。

如果服务器返回错误状态码、JavaScript渲染失败、筛选页面生成无限URL、移动端丢失内容或者站点迁移重定向配置错误,普通SEO插件很难自动解决。

技术SEO往往需要SEO人员、开发人员、服务器运维和内容团队共同处理。

哪些项目应该优先处理

如果面对一个刚开始优化的网站,没有必要同时修改几十项技术指标。更合理的是按照影响范围排序。

  1. 先确认重要页面可以正常访问和建立索引。

  2. 检查robots.txt、noindex和Canonical。

  3. 解决404、5xx和错误重定向。

  4. 确保重要页面有正常内部链接。

  5. 整理Sitemap和重复URL。

  6. 检查移动端和JavaScript渲染。

  7. 再逐步改善页面性能和Core Web Vitals。

  8. 根据网站类型添加合适的结构化数据。

  9. 大型网站再进一步处理抓取效率。

技术SEO真正解决的不是“让Google喜欢某个技术参数”,而是减少搜索引擎理解网站时遇到的障碍。对于只有几十个页面的小型内容站,技术工作可能主要集中在索引、Sitemap、Canonical和性能;对于拥有数十万页面的电商或国际网站,URL参数、JavaScript渲染、hreflang、重复页面和抓取管理的重要性会明显增加。

所以技术SEO并不存在一张所有网站都必须完成的固定清单。更有效的方式,是先确认网站从“URL被发现”到“页面进入索引”的整个过程,再根据网站规模和技术架构找到真正影响搜索表现的环节。

参考资料

  1. Google Search Essentials技术要求

  2. Google抓取与索引官方文档

  3. Google JavaScript SEO基础指南

  4. Google Core Web Vitals说明

  5. Google结构化数据官方指南