如何判断你的 GA4 流量激增是不是机器人
GA4 自带的机器人过滤只会剔除已知的 IAB 和 Google 收录的爬虫——它抓不住无头浏览器抓取,也抓不住直接打到你媒体资源 ID 上的 Measurement Protocol 请求,这两种流量在报告里都表现得像正常会话。在为流量激增欢呼之前,先检查三个数字:平均参与时长、回访用户比例,以及"直接"流量占会话的比例。如果参与时长低于 15 秒、回访用户低于 5%,且"直接"流量超过 80%,你看到的是自动化流量,而不是增长。
每周三。28,400+ 读者。纯干货。
✓ 请查收邮箱 — 点击确认链接以完成订阅。
✓ 订阅成功!
✓ 您已在订阅列表中。
2026 年 8 月发布。
TL;DR: GA4 自带的机器人过滤只会剔除已知的 IAB 和 Google 收录的爬虫——它抓不住无头浏览器抓取,也抓不住直接打到你媒体资源 ID 上的 Measurement Protocol 请求,这两种流量在报告里都表现得像正常会话。在为流量激增欢呼之前,先检查三个数字:平均参与时长、回访用户比例,以及”直接”流量占会话的比例。如果参与时长低于 15 秒、回访用户低于 5%,且”直接”流量超过 80%,你看到的是自动化流量,而不是增长。
运营者视角: 我在写这篇文章时调取了本站自己的 GA4 数据。“直接”流量占了 77.8% 的会话,平均参与时长是每个活跃用户 12 秒,只有 0.5% 的用户回访过。这些数字单独拿出来看,每一个都有无辜的解释。放在一起看,就没有了。正因如此,我现在不会相信任何会话数字,除非它先过一遍下面这份检查清单——我也建议你别信。
流量激增之所以令人兴奋,恰恰是因为它本该意味着一些东西:正在奏效的内容、正在带来回报的渠道、可以拿出来说的势头。这正是为什么,在你据此采取行动之前——重新分配预算、告诉客户这招奏效了,或者把这个窗口期当作日后衡量的基准——花 10 分钟确认这波流量是真人而不是抓取程序是值得的。
目录
展开目录
为什么 GA4 的机器人过滤救不了你
GA4 自带常开的机器人过滤,你没有开关可以关掉它——Google 会自动剔除匹配 IAB/ABC 国际蜘蛛和机器人列表的流量,在它进入你的报告之前就已经被过滤掉。这是真实存在的,也是为什么你看到的计数并非原始数据。但这份名单只是一份”已知机器人”名单。它能抓住那些会主动表明身份的已识别爬虫。它抓不住:
- 无头浏览器抓取。 一个用 Puppeteer 或 Playwright、带着真实 Chrome User-Agent 运行的脚本,在 GA4 看来,和一个打开浏览器的真人一模一样。请求里没有任何东西能标明它是自动化的。
- 直接打到你媒体资源 ID 上的 Measurement Protocol 请求。 GA4 的 Measurement Protocol 是一个公开 API。如果你的媒体资源 ID 泄露了——而
gtag.js会把它以明文形式发给每一个访客的浏览器——任何人都可以写脚本直接向你的媒体资源发送事件,完全不需要经过页面加载。这会表现为一批会话,却在任何其他地方都找不到对应的真实流量:没有服务器日志命中,没有广告投放,也没有能解释它的引荐来源。
这两种在你的报告里看起来都是正常的、被过滤过的、合法的会话。IAB 名单能保护你不受那些会主动表明身份的机器人的侵扰。对那些不表明身份的机器人,它无能为力。
过滤器漏掉的部分,靠这三个数字来抓
在你根据任何一次激增采取行动之前,先让它过一遍这三项检查。单独看,它们谁都证明不了什么——一次短会话、一个没有回访的访客、一次”直接”命中,都完全正常。真正说明问题的是它们的组合。
1. 每个活跃用户的平均参与时长
阈值:低于 15 秒就可疑。
一个真实访客哪怕只读一个很短的页面,花的时间也会超过 15 秒——滚动、读标题、决定要不要留下来。一个脚本打开一个 URL、记录一次 pageview 事件,然后跳到列表里的下一个 URL,不会这样做。如果一次激增的平均参与时长是个位数,那么大部分所谓的”流量”根本没有真的看过任何东西。
2. 回访用户比例
阈值:如果这次激增本该代表真实的受众增长,低于 5% 就可疑。
真实的受众——哪怕是你刚开始建立的受众——会回来。一个通过搜索找到你、喜欢你写的内容、有理由再来看看的人,会在几周内以回访用户的身份出现。一次性的抓取,或者一波 Measurement Protocol 垃圾流量,永远不会回来,因为它背后没有一个有理由回来的人。
这是我最信任的一个数字,因为它最难被无意中伪造出来。合法的流量来源——哪怕是投给陌生人的付费广告——在几周内也总会产生一些回访用户。纯粹的机器人流量基本上从来不会。
3. “直接”流量占总会话的比例
阈值:超过 80% 是一个警示信号,不是定论。
这一条要小心使用。有一部分”直接”流量是真实的,只是没打标签:有人打开一个保存过的链接、原生 App 内嵌网页剥离了引荐来源、AI 助手的引用链接落地时没带 UTM。单看”直接”流量高,并不能说明是机器人。但当它和短参与时长、接近零的回访用户组合在一起时,它就不再是”未打标签的真实流量”,而变成了自动化流量在完全不带引荐来源时默认落入的那个桶。
把它当成一个需要调查的提示,而不是机器人流量本身的度量。 别因为一个数字就砍掉你的”直接”渠道。
运行这项检查
针对你这次激增覆盖的时间窗口,拉一份 GA4 报告——标准的”报告”快照,或者一个 Explore 工作区——然后同时看这三样:
| 信号 | 看起来正常 | 值得调查 |
|---|---|---|
| 每个活跃用户的平均参与时长 | 15 秒以上 | 低于 15 秒 |
| 回访用户 | 5% 以上 | 低于 5% |
| “直接”流量占会话比例 | 低于 80% | 超过 80% |
单独出现一个警示信号:耸耸肩,继续往下走。两个或三个同时出现,尤其是这次激增从某个具体日期突然开始、却没有任何对应的原因(没有新的反向链接、没有活动上线、没有媒体报道):在你追溯到源头之前,先别信这个数字。
要追溯源头,按落地页、设备类别和地理位置对这次激增做细分。机器人流量往往会扎堆——几百次会话全部命中同样的三个 URL,或者全部报告同一个设备型号,又或者集中在几个你没有理由拥有真实受众的、数据中心密集的国家。真实流量要凌乱得多——它扩散到你的内容上的方式,就跟真实兴趣扩散的方式一样。
确认之后该怎么做
- 不要在被污染的窗口期上构建报告、预算决策或客户汇报。 如果你在为任何事情追踪一个”之前”的基准——一次 SEO 活动、一份 GEO 服务、广告支出的 ROI——一段被污染的时期会毒化这个对比,只要这个基准还在被使用,污染就会持续存在。窗口期一旦结束,就没有办法事后重建一个干净的数字。
- 一旦你识别出模式,就在 GA4 端加一个过滤器。 如果垃圾流量集中在某个主机名上(别人的网站指向了你的 Measurement ID,或者一个预发布环境泄漏了带标签的真实流量),就在 GA4 的”数据流”设置里加一个有效主机名过滤器。如果它集中在行为模式上,一个针对低于阈值的参与时长的、会话范围的自定义维度能帮你解决大部分问题,不过 GA4 不允许你回溯性地剔除已经落地的会话。
- 如果是持续性的而不是一次性的,就在边缘拦截。 如果你用的是 Cloudflare,一条机器人管理或速率限制规则能在下一波流量打到你的分析数据之前就拦住它——比事后过滤更省钱,也能顺带减轻你真实服务器上的负载。
- 不要整体丢弃”直接”流量。 其中有一部分是你无法归因的真实的人——包括越来越多的、在 AI 助手的回答里读到你的内容、然后事后在浏览器里输入你名字的人。那是一个真实的结果,如果你把它跟噪音一起丢掉就太可惜了。参见我如何衡量 AI 搜索流量,了解如何把这个信号从”直接”流量的其余部分里分离出来,而不是直接放弃整个渠道。
常见问题
这是不是说明我的流量激增是假的?
不一定——先跑一遍这三项检查。很多真实的激增(一篇爆款文章、一个更大网站的提及、一次成功的广告投放)会表现出健康的参与度和正常的”直接”流量比例。这份检查清单是用来抓那些不正常的激增,不是让你怀疑每一次增长。
为什么 GA4 不直接自动过滤这些?
IAB 机器人名单只覆盖那些通过已知特征表明自己身份的爬虫。一个带着合法 Chrome User-Agent 的无头浏览器,或者一次直接打到 Measurement Protocol 的原始 API 调用,不会呈现任何可供过滤的特征——在 GA4 看来,它和一次真实的 pageview 没有区别。要抓住它,需要 GA4 不会自动应用的行为信号,这正是为什么手动检查很重要。
我应该等多久再相信一次激增?
要等到足够久,看看回访用户会不会出现——我建议至少给它两到三周。一次激增,如果过了这个窗口期之后回访用户依然接近于零,并且参与时长依然很短,那么它不会随着时间推移变成真实受众。它只是更多的同一种流量。
每周三。28,400+ 读者。纯干货。
✓ 请查收邮箱 — 点击确认链接以完成订阅。
✓ 订阅成功!
✓ 您已在订阅列表中。
相关文章
将AI实战手册发送到您的邮箱
每周三。28,400+ 读者。纯干货。
请查收邮箱。
我们已向您发送确认邮件 — 点击其中的链接以完成订阅。如果一分钟内没收到,请检查垃圾邮件。
订阅成功。
欢迎 — 下一期很快就会送达您的邮箱。
您已在订阅列表中 — 每周三留意查收。