METHODOLOGY · 口径与方法

口径与方法

同一个词,口径不同结论可以完全相反。这一页是事实库的说明书: 每个指标怎么定义、怎么算、不包含什么,都写在这里。

当前事实库查询日:2026-09-24

指标口径

被引 / 带被引链接的引用

AI 回答中给出 URL 的引用。

怎么算
每条记录逐条判断回答里是否含可追溯链接,含则计入「带被引链接的引用」。
不包含
只提到名字、没给链接的不计入;两者分组呈现,不合并、不相加。

去重网页 / 去重网站

在带被引链接的引用里,按 URL、按域名分别去重后的数量。

怎么算
URL 去重 → 去重网页数;同级子域合并后去重 → 去重网站数(域名口径)。
不包含
不含未给链接的提及;探针语料另计。

提及率(三个口径并列)

AI 回答中出现我方的占比。分三组各自计算:A 品牌词问法(问题文本含我方品牌词)、B 全部意图问法(非品牌词的其余全部问法)、C 六个核心目标问法(SOP 固定的复测集)。

怎么算
每组各自算:分子为回答中出现我方的条数,分母为该组的记录数;三组同时公布,不给「总提及率」。
不包含
三组不合并、不相加、不跨组算比例——A 测「被认识」,B 与 C 测「被推荐」,混算只会得到一个没有含义的数字。提及口径不区分正负。

引用率 / 推荐率

引用率=品牌内容在 AI 回答中被引用的比例;推荐率=品牌被作为推荐对象呈现的占比。

怎么算
系统内为唯一计算出口,驾驶舱、报告与验收单同源同口径。
不包含
分母过小时标注「样本不足」,不按 0 处理。

探针语料

由品牌词自动生成问题、经多个 AI 引擎提问后入库的回答语料。

怎么算
受众画像读取全部语料(含探针)。
不包含
全系统其它统计口径统一排除探针语料,避免自测抬高自己的可见度。

平台口径

已接入 12 个中文 AI 平台,本期实抓 11 个。

怎么算
实抓数量以系统平台配置里的有效抓取清单为准。
不包含
本期未纳入实抓的平台不计入任何分子分母;不对第三方平台自身状态作断言。

HOW IT IS COMPUTED

信源统计怎么做(五步)

这一节回答《AI 引用的网页都来自哪儿》里的数字是怎么来的。 算法一变结论就变,所以步骤全部摊开写;我们不发布无法回溯的「AI 最信任信源排行榜」。

  1. ① 口径先行

    先写死三行定义再采集:抓取记录(一次提问配一条回答算一条,含没有引用的)、带被引链接(回答文本里出现以 http 开头的 URL)、去重域名(剥到主域名再去重)。三个口径任何一个变了,结论都会反过来。

  2. ② 链接级去重

    把回答里的 URL 逐条抽出来,按完整链接去重,得到去重网页数。这一步定下后面所有百分比的分母——是带链接的引用数,不是全部记录数。

  3. ③ 域名归并

    把链接剥到主域名再去重,得到去重网站数。这一步最常被跳过,跳过之后同一家会被算成好几家,网站总数虚高,后面所有占比都失真——三个坑见下表。

  4. ④ 算集中度

    按域名聚合被引次数,排序后取前 10 / 前 30 的累计次数与占比,同时看长尾:只被引 1 次的域名有多少。头部占比高、长尾占近一半,往长尾位置铺内容的天花板从一开始就是锁死的。

  5. ⑤ 再加一层交叉引用

    同一条链接(或同一域名)被 ≥2 个 AI 平台引到才计入。链接级与域名级两个口径并列、不互换——它们相差数倍,只说一个等于没说口径。

最容易错的一步:域名归并的三个坑

坑典型表现不处理会怎样
移动版是独立子域m.163.com 与 163.com同一家媒体被算两次,网站总数虚高
部分中文站是独立域名cloud.tencent.com 与 cloud.tencent.com.cn按字符串去重时,它们永远是两家
频道子域要不要合并,取决于你要回答什么zhuanlan.zhihu.com 与 zhihu.com要回答「哪些栏目」就不能合并;要回答「哪些站」就合并到主域名

DATA RULES

数据纪律

  • 每个数字都必须能追到:查询日 + 数据源 + 样本规模 + 计算口径——四样缺一不对外。
  • 数据是时点快照:带被引链接的引用变化较快,隔天引用请重跑,不要沿用旧值。
  • 同一个数字在官网、文章、报告里必须同口径同查询日;营销表达中的事实主张以事实库为准。
  • 只增不删:口径修订保留历史值,避免"同一个词前后不是一回事"。

这套口径对我们也同样适用:写进文章、报告与对外说明的每个数字,都能在事实库里找到同口径同查询日的版本; 找不到依据的结论,我们只标「推断」。对口径有异议或想复核某条数据,联系我们。