SSRdog科学跨境直连平台

SSRdog 科学跨境直

p值过了0.05,就代表发现成立吗:效应量、区间与实际重要性怎么一起读

p值只回答数据与特定统计模型是否相容,不能替代效应大小、区间精度与研究设计。本文用两个结果相反的研究场景,说明如何把阈值判断改成估计、区间、透明度和适用边界的联合阅读。

两个研究不能只按0.05排序

研究甲报告差异0.2个单位,p值为0.04。研究乙报告差异2个单位,p值为0.08。若只看0.05,甲会被称为有发现,乙则可能被写成没有差异。

这种排序漏掉了最关键的问题。0.2个单位是否值得关心,取决于测量尺度、成本和现实后果。2个单位的区间若很宽,也说明方向与大小仍不确定。

因此,p值、效应估计和置信区间承担不同任务。它们需要放在研究设计、样本量和报告透明度中一起阅读。

p值描述数据与模型的关系

ASA的第一项原则把p值限定在指定统计模型内。它表示观察数据与模型所设条件有多不相容,而不是直接给研究假设打真伪分数。

常见误读是把p等于0.03解释成零假设只有3%可能为真。ASA明确否定这种说法。p值也不等于数据仅由随机机会产生的概率。

计算过程通常先假定一个模型,再问若模型成立,出现当前结果或更极端结果会有多罕见。模型中的抽样、误差结构和分析选择若不合理,数字再小也不会修复这些问题。

所以读者应先问零假设是什么、比较对象是什么、哪些条件被假定成立。离开这些条件,单独抄下p值没有完整含义。

效应大小回答实际差异

ASA还指出,统计显著性不衡量效应大小,也不衡量结果的重要性。效应估计才告诉我们差异朝哪个方向、相差多少,以及单位是什么。

药物研究中的2毫米汞柱、教学研究中的0.2个标准差、网站实验中的0.3个百分点,不能用同一把尺评价。实际重要性需要结合基线风险、实施成本、替代方案和最低有意义差异。

大样本能够把很小的标准误带进计算。此时,微小而稳定的效应也可能得到很小的p值。它在统计上可分辨,却未必值得改变决策。

反过来,小样本可能出现较大的点估计,但不确定性很高。把它写成完全没有效应,同样越过了证据边界。

置信区间同时展示方向与精度

NIST把置信区间用于表达参数估计的不确定性。区间较窄,表示在相应方法和假设下,估计较精确;区间较宽,则保留更多可能值。

p值过了0.05,就代表发现成立吗:效应量、区间与实际重要性怎么一起读 配图 1
p值过了0.05,就代表发现成立吗:效应量、区间与实际重要性怎么一起读 配图 1

95%信赖区间不是说已算出的区间有95%概率包含固定真值。NIST给出的频率学派解释是,若反复抽样并用同一方法计算,长期约95%的区间会涵盖真值。

区间还能让读者看到零值之外的范围。若差异区间为负0.1到0.5,数据既与轻微负效应相容,也与正效应相容。若最低有意义差异是1,这整个范围还可能都不具实际意义。

在相同模型、尾部和显著性设定下,NIST说明双侧检验与区间是否包含假设值有对应关系。区间比二元标签多给了一层大小与精度信息。

样本量和噪声改变精度

NIST的均值区间公式显示,样本量增加会让区间变窄,样本标准差增加会让区间变宽。样本多和数据稳定,都会提高估计精度。

这解释了一个常见对照。大样本研究可能发现0.2个单位的微小差异,区间很窄,p值也小。小样本研究可能估计2个单位,却有横跨负值与正值的宽区间。

前者告诉我们微小差异测得较精确,不自动说明差异重要。后者说明当前数据不足以精确定位效应,不等于真实效应必定为零。

增加样本只能处理部分抽样不确定性。若纳入人群偏离目标人群,量表没有测到目标概念,或分组受到混杂,窄区间仍可能围绕有偏估计。

阈值附近没有统计断崖

p值0.049与0.051十分接近。若两个研究设计相似,它们不应被描述成一个证实发现、另一个证明无效。

ASA反对只凭是否越过阈值作科学、商业或政策决定。它同时要求完整报告和透明度,因为只展示最小p值,会让读者看不到分析尝试的数量。

研究若测试许多结局、亚组或模型,却只报告越过阈值的一项,偶然小值会更容易出现。读者需要知道主要结局是否预先指定,遗漏数据如何处理,以及替代模型是否改变结论。

p值过了0.05,就代表发现成立吗:效应量、区间与实际重要性怎么一起读 配图 2
p值过了0.05,就代表发现成立吗:效应量、区间与实际重要性怎么一起读 配图 2

阈值可作为约定的决策规则,却不能制造知识断崖。连续证据应保留连续表达,结论强度也要随精度、设计和重复验证调整。

六项顺序比一个标签可靠

第一,写清研究问题和目标人群。第二,记录效应方向、大小与单位。第三,查看置信区间覆盖哪些实际可能值。

第四,再读p值及其检验假设。第五,记录样本量、缺失情况、主要与次要分析。第六,检查设计能支持关联还是因果,结果能推广到哪些人群。

一张简表可以固定这些栏目:研究问题、效应与单位、区间、p值、样本量、分析透明度和适用人群。若缺一项,就把缺口保留在结论中。

对研究甲,可写成微小差异估计较精确,但是否重要需看实际门槛。对研究乙,可写成点估计较大,但区间过宽,现有数据无法确定方向和大小。

结论停在设计边界

显著不等于重要,未显著不等于没有效应。区间包含零,也不表示区间内所有效应都不重要。它只说明在当前方法下,零值仍与数据相容。

精确估计也不能修复偏倚、错误测量或不合适的模型。观察研究中的小p值不会自动建立因果,单一人群的结果也不能自动推广到另一人群。

p值过了0.05,就代表发现成立吗:效应量、区间与实际重要性怎么一起读 配图 3
p值过了0.05,就代表发现成立吗:效应量、区间与实际重要性怎么一起读 配图 3

ASA说明p值不等于假设为真的概率,也不衡量效应大小或结果重要性。NIST把95%信赖区间解释为区间方法在重复抽样中的长期涵盖率。

样本量与数据波动通过标准误同时影响区间宽度和p值,因此相同效应可得到不同显著性结果。最终判断应保留效应、精度、透明度和适用范围,而不是停在0.05的两侧。

把数字放回一个实际决定

假设一项工作时间实验比较两种排班方式。平均差异为4分钟,95%区间为1到7分钟,p值为0.02。这个结果支持差异方向较稳定,却不能单凭数字判断新排班值得实施。

若每班调整成本很高,4分钟可能没有实际价值。若关键流程只需改善2分钟,区间下限仍超过这个门槛,结论会更有决策意义。最低有意义差异必须在看结果前说明,不能事后配合数字移动。

再看一项小型试验。平均差异为12分钟,区间为负3到27分钟,p值为0.11。它没有越过0.05,却也没有证明两种排班相同。当前数据仍允许轻微反向差异,也允许很大的正向差异。

合适的结论是估计方向有利,但精度不足,仍需更多数据。若直接写成无效,会把宽区间中的可能收益全部抹去。

区间宽度也暴露研究代价

宽区间不仅是统计标记,还会改变行动方式。若整个区间都落在可忽略范围内,即使p值不小,也可较有把握地排除有意义的效应。

若区间同时覆盖伤害、无差异和明显收益,研究对方向尚无区分力。此时最有价值的问题不是数字是否显著,而是增加样本、改进测量或缩小人群差异,哪一项能减少关键不确定性。

窄区间若围绕微小效应,说明估计精确但作用有限。宽区间若围绕大点估计,说明潜在作用可观但证据不稳。这两种情况需要不同的后续决定。

报告缺口必须留在判断里

如果摘要只给p值,没有原始单位或区间,读者无法判断差异大小与精度。若主要结局、排除规则和样本终止时间没有说明,也无法知道分析自由度有多大。

这时不要替研究补出肯定结论。可以明确写成效应大小未报告、精度无法评估,或分析选择不够透明。缺失信息本身就是判断的一部分。

同理,一个可靠的结果仍需要重复研究和外部验证。相同效应在不同场景、人群与测量条件下是否保持,属于新的证据问题,不能由单次p值代答。

资料来源

  • 美国统计协会:《American Statistical Association Releases Statement on Statistical Significance and P-Values》,发布或更新于 2016-03-07
  • 美国国家标准与技术研究院:《Confidence Limits for the Mean》,发布或更新于 2026-04-22
  • 美国国家标准与技术研究院:《What is the relationship between a test and a confidence interval?》,发布或更新于 2025-09-12