监测口径与方法

数据能被复核才有意义。这一页把我们的采集口径完整摊开——哪些模型、怎么采、指标怎么算,以及我们不做什么、暂不公开什么。更新日期:2026-10-08。

一、纳入监测的模型

逐条写死具体版本号,不用模糊别名长期跑;每季度复核一次 C 端默认模型是否升级。

模型厂商当前版本
豆包(快速模式)字节跳动doubao-seed-2-0-mini-260428
DeepSeek深度求索deepseek-v4-1-flash-260910(经火山方舟托管接入)
千问阿里qwen3.7-max
文心百度ernie-5.1
Kimi月之暗面kimi-k2.6

没有纳入的两个

  • · 豆包专家模式(长思考)按我们的监测规则不纳入常规采集
  • · 元宝因接口稳定性问题暂停纳入,恢复后会更新本页与事实文件

二、怎么采集

一条样本是什么
一条样本 = 一个模型 × 一条问法 × 一次回答
问法从哪来
按患者真实问法建词库,覆盖机构名、科室、病种、地域等多个层级
重复采样
同一条问法的重复采样次数按机构配置,1~5 次,默认 1 次;重复采样时取多数结论,用于压低单次回答的随机抖动
随机性控制
除 Kimi 因模型限制必须为 0.6 外,其余模型均为 0,以降低随机性、提高可比性
时间窗
报告固定标注采集时间窗与样本量,不混用不同时间窗的数据
看哪些指标
提及率;引用次数与来源分布;信息准确度(名称是否用全称、科室与职称是否被泛化、技术名是否被通用化)。
报告标注平台、问法、样本量与时间窗,机构可按同样方法自行复核

三、可引用的实测观测

以下是我们自己实测中得出的两条结论,都带时间窗与样本量,机构名按授权范围匿名处理。

2026-09-08 ~ 2026-09-22 · 某妇产专科机构

两周内被 AI 引用 215 次,覆盖 27 篇文章与 15 个问题;引用来源集中在单一平台

结论:不能用单一平台的数据推断整体 AI 可见度;监测须覆盖多个平台并单列来源分布

2026-09 · 两家机构(妇产专科 / 口腔连锁)

提及率分别为 6.9%(两周同站对比升至 20% 以上)与 47.2%(670 次采集、316 次提及)

结论:提及率只说明有没有被讲到;还必须看信息准确度,报告固定给出「提及率 + 信息变形清单」

具名机构与逐项数据在客户案例页——那两家机构已书面同意我们使用其名称与实测数据。

四、我们不做什么

不承诺效果不承诺任何 AI 平台的排名、引用或流量结果——AI 回答受模型版本、时间与公开信息来源多重影响,我们只对采集与交付过程负责。
不编数据没有来源的数字不写;个案数据不当普遍结论用。
不做「投喂大模型」不用误导性内容去影响 AI 输出,也不做刷量。
不替机构定医疗口径医学术语与诊疗表述的最终口径由机构与专业人员确认后发布,我们只做表达与结构。

五、暂时不公开的数据

写出来是为了避免「没写 = 不确定」被随意发挥——这些不是没有,是有原因地不放。

客户机构名称与逐项实测数据的对应关系原因:仅在机构书面授权范围内披露,具名数据见客户案例页
报价与合同条款原因:按机构规模与项目范围定制,不对外给统一价
办公地址原因:未在公开渠道披露;需要寄送或上门沟通请联系 15506996188
工商公示以外的资质证书清单原因:正在整理核对,可核验后会补进本文件

六、常见问题

Q:你们监测哪些 AI 模型?

A:当前纳入 5 个:豆包(快速模式)、DeepSeek、千问、文心、Kimi。逐条写死版本号,季度复核一次是否升级。豆包专家模式(长思考)按我们的监测规则不纳入常规采集;元宝因接口稳定性问题暂停纳入,恢复后会更新本页与事实文件。

Q:一条数据是怎么算出来的?

A:一条样本 = 一个模型 × 一条问法 × 一次回答。同一条问法可以配置重复采样 1~5 次(默认 1 次),重复时取多数结论,用来压低单次回答的随机抖动。报告里的样本量就是按这个口径数的。

Q:为什么你们的数字可以复核?

A:报告标注采集平台、问法原文、样本量与时间窗,客户可以按同样的问法、同样的时间窗自己跑一遍对照。凡是不能这样复核的数字,我们不写进对外内容。

Q:你们不公开哪些数据?

A:客户机构名称与逐项实测数据的对应关系;报价与合同条款;办公地址;工商公示以外的资质证书清单。原因写在 /methodology 页面与本页正文里。

想看这套口径跑出来的结果?

我们拿贵院的真实采集结果讲,包括提及率、引用来源分布与信息变形清单。

预约演示