GRIM Test(均值粒度自洽性)
最轻量的核查:只需要论文印着的样本量 n 和均值 M,检验该均值在数学上是否可能。 无需原始数据,30 秒出结果。适合读论文、审稿、做系统综述时快速核查。
参考:Brown & Heathers (2017), “The GRIM Test”。→ GRIM 方法详解与在线检验
Benford's Law(首位数字定律)
自然数据的首位数字服从特定分布:1 出现约 30.1%,2 约 17.6%,9 约 4.6%。 人造随机数据常偏离此规律——造假者倾向于让首位数字「看起来随机」, 反而使分布过于均匀。
参考:Newcomb (1881), Benford (1938), Nigrini (1996)。→ 试用 Benford 检测
Terminal Digit Analysis(末位数字分析)
真实测量值的末位(最后一位有效数字)应近似均匀分布 0-9。 Mosimann et al. (1995) 发现:人手编造的数据末位常偏好 0 和 5, 因为人在「想随机数字」时会下意识选择这些「看起来整」的数。
参考:Mosimann, JE et al. (1995), “Data fabrication: Can people generate random digits?”→ 试用末位检测
Variance Anomaly(方差异常)
真实生物、心理、社会数据有自然变异。伪造数据常「太干净」—— 方差过小、拟合过完美、p 值反常集中在 0.04-0.05 临界区。 这类异常是论文工厂批量生成数据的典型痕迹。
参考:Hartgerink CHJ (2016), “The value of statistical tools to detect data fabrication.”→ 试用方差检测
Digit Pair Frequency(数字对频率)
相邻数字对的真实分布有规律。造假者常刻意避免相邻重复数字(如 11、22), 认为这样「看起来更随机」,但这种刻意反而暴露伪造痕迹—— 真实数据中相邻重复是正常现象。
⚠️ 重要:以上方法均为「辅助筛查」,任何单一异常都不足以判定数据造假。 统计异常可能由数据特征、样本量、测量方式等多种因素引起。 最终判断应由具备资质的机构按正当程序做出。