先说结论

这份报告不该被改写成“Perplexity 被 21.5 万篇假文章骗了”的惊悚标题。更准确的结论是:在研究者构造的 380 个软件类别与一次固定快照里,AI 推荐的证据层出现了规模异常、模板高度相似、面向机器写作痕迹明显的来源;这些来源能进入引用链,但报告没有逐篇证明内容为假,也没有证明删除它们会改变最终推荐。对创作者真正重要的问题是,AEO/GEO 如果只奖励可抓取与可引用,可能把“像证据”放到“有证据”前面。

21.5 万这个数字从哪里来

研究者读取三个站点的 sitemap,分别统计到 70,731、71,684 和 72,713 个 `/best/<something>-software/` 页面,合计 215,128。三个站每个只有六篇博客文章,却覆盖远超现实软件分类数量的购买指南。它们使用相同页面模板、导航和分类结构,并共享一对 Cloudflare nameserver;报告把这些组合证据解释为共同运营的强旁证,同时明确说不知道真正所有者是谁。写作时必须保留这句限制,不能仅凭 nameserver 就点名归属。

另一条更微妙的信号来自 Guideflow。它本身销售交互式产品演示,不是通用软件评测媒体,但其博客在 380 个类别中的 96 类出现,共获 194 次引用,在该快照中排到第三并超过 Gartner。这不自动证明文章错误,却说明一个厂商通过大规模内容营销,可以在与自身产品无直接竞争关系的采购问题里成为“证据”。被引用次数和独立性不是同一个指标。

原报告没有证明什么

测试只覆盖 Perplexity,且每类只跑一个措辞、一次请求。两个被比较的模型档位在 380 类中有 289 类返回字节级相同的引用清单,URL 集 Jaccard 重合度为 0.898,因此更像共享检索层的两个入口,不是两个独立模型互相验证。研究也没有覆盖中文问题、地域差异、重复采样和时间漂移,未测 ChatGPT、Gemini、Copilot 或 Google AI Mode,更没有做“移除可疑来源后推荐是否变化”的反事实实验。

中文复测可以怎么做

选 20 个有真实购买决策的中文类别,每类准备“最好”“最常用”“适合小团队”“中国大陆可用”四种措辞,在不同日期各跑三次。记录完整答案、引用 URL、域名年龄、作者与利益关系、页面是否提供原始数据、是否能追到厂商文档,并由两名人工独立判断证据是否真正支持句子。结果公开为数据表,报告系统差异,不公布没有证据的运营者指控。

内容团队也可以反向采用六项免费规则:署名真实作者,链接原始数据,披露商业关系,标注更新时间,保留反例与限制,定期人工抽查。这样做可能不会瞬间制造十万条 URL,却能让读者和检索系统都知道一条结论凭什么成立。

创作者可以直接复制的简报

“请复现一项 20 类中文软件推荐审计,跨四个平台、四种提示、三次重复运行。输出引用来源、证据命中、商业关系、模板重复与结论稳定度;明确原始 Trellner 研究只覆盖 Perplexity 单日快照,215,128 是 sitemap URL 合计而非逐篇判假。所有原始表格、方法和限制公开,不把研究写成对未知运营者的指控。”

搞着玩实验室免费接收复测数据与选题创意;如需围绕你自己的站点做诊断、原型或固定范围 MVP,可在事实边界确定后另行约定服务范围。