DE-G中Attribute Gage Study为什么选择Wilson Score构造置信区间

Attribute Gage Study(属性量具研究)主要用于制造业、质量控制及实验室检测等场景中,当测量结果为计数型数据(如合格/不合格、通过/不通过、外观缺陷等级等)而非连续数值时,用来评估测量系统(人员、设备、方法、环境等)的一致性(agreement)和有效性(effectiveness)。由于属性判定本质上是“合格/不合格”这类两个值的结果的伯努利试验,因此检验员对同一零件多次重复判定的一致次数自然服从二项分布,这使得我们能够基于该分布计算观测到的一致性或者有效性构造一致率的置信区间,并据此统计推断测量系统的稳定性与可靠性,从而将“一致性”和“有效性“的直观概念转化为可量化的二项分布假设检验问题。 而二项分布的置信区间的估计有多种方法,各种方法存在各自的优缺点。本文将在讨论各种方法的优劣,并说明为什么在DE-G中Attribute Gage Study功能选择使用了Wilson Score方法来构造置信区间。 ## PART 1二项分布的背景 二项分布(Binomial Distribution)是统计学中最基础、最经典的概率分布之一。它描述的是在固定次数的伯努利试验中,某事件恰好发生 k 次的概率。 所以,根据这个定义,对于随机变量x满足二项分布,即x~Bin(n,k),那么关于二项分布的概率质量函数(PMF)就是: ![img_01.png](/uploads/forum/20260730/bfcfaa03a98b8f4163b5d71ad34066f4.png) 因此整个概率质量函数球的刚好是n次试验恰好成功k次的概率。 ## PART 2 概率p的估计以及置信区间的构造方法 对于二项分布,在样本已知的情况下,总的试验次数n以及试验成功的次数k是已知的,因此需要估计的参数只有试验成功的概率p,并且也只需要对p构造置信区间。下面将介绍p的估计方法以及三种不同的置信区间的构造方法。 ### 01概率参数p的估计 α. 矩估计 二项分布的矩估计是非常直观的,如果随机变量满足,那么通过的一阶矩/数学期望进行估计,则: ![img_02.png](/uploads/forum/20260730/5a33655d178adf31581d411d747c92b2.png) β. 极大似然估计 对于一个二项分布,如果我们观测到了k次成功,那么其概率质量函数就是其似然函数,即: ![img_03.png](/uploads/forum/20260730/b4e13bd99391dc3bb7e637b7b17ef15a.png) 那么可以得到其对数似然函数: ![img_04.png](/uploads/forum/20260730/dbd9ff6b1a9e58c5c4de43859868e7f1.png) 对其一阶导等于0,然后解方程我们可以得到其极大似然估计,也就是: ![img_05.png](/uploads/forum/20260730/e7ac9fd879c95e85a84552e562612ab9.png) 图片 最终无论是矩估计还是极大似然估计,二者估计的方式是相同的。并且根据期望的线性性质,我们可以验证两种估计方法都是无偏估计,其数学期望为: ![img_06.png](/uploads/forum/20260730/b941ae27c769ac9a6f4543f3e6be67f1.png) 以及可以计算得到这两个估计得到的方差为: ![img_07.png](/uploads/forum/20260730/f30f8232ab9a1177eb3d35c8350d3ae0.png) 不难证明,这个无偏估计的方差刚好达到了Cramér-Rao下界,因而是有效的。 除了上述两个估计方法以外,还有其他很多有偏的但是某一些性质更好的估计方法,比如基于修正Wald方法的中点等,在此不赘述。但是需要注意的是,以下三种置信区间的构造方法和上述无偏估计以及其方差是紧密相关的。 ### 02. 置信区间的构造方法 α. Wald区间 Wald方法是非常经典的置信区间构造方法,并且在样本量大的时候得到广泛的应用。Wald方法依赖于de Moivre-Laplace中心极限定理(de Moivre-Laplace Central Limit Theorem),让估计量通过一定的变换可以依分布收敛到标准正态,其原理是 ![img_08.png](/uploads/forum/20260730/f4e98d364e6b01accd38ee42049c9943.png) 也就是 ![img_09.png](/uploads/forum/20260730/0297791c34216d67dca1384e536f0945.png) 由于实际应用中,p是未知的,所以一般情况我们通过样本估计得到之后代替方差项的p,然后基于上述的极限分布,我们才可以得到: ![img_10.png](/uploads/forum/20260730/61ddd5a9e74c15985ab26c529f0b26b7.png) 进而到p的置信区间: ![img_11.png](/uploads/forum/20260730/cd0a8c0b35870fee2eaa16ff1c84d51a.png) Wald方法因其建立在中心极限定理之上而被广泛地应用,与此同时,它的优缺点也自然继承自中心极限定理的基本特性。 首先,由于中心极限定理形式简洁、计算便捷,且对总体分布形态没有苛刻要求,基于该定理的Wald方法在实际应用中很容易实现,尤其适合在大样本情形下快速构建参数的近似置信区间。 其次,中心极限定理给出的渐近方差恰好达到了Cramér-Rao下界,这意味着在无偏估计量的场合,Wald方法所给出的置信区间在渐近意义下已经达到效率的界限,很难通过同类方法在保持相同置信水平的前提下得到更窄的区间。 然而,中心极限定理的收敛速度问题也为Wald方法带来了明显的局限。定理中向正态分布的收敛是一种“依分布收敛”,且在不少实际分布中收敛速度较慢,导致Wald方法构造的置信区间通常需要很大的样本量才能达到较好的近似效果。在样本量较小时,该方法覆盖真实参数的可靠性往往不足,容易产生明显的偏误或区间覆盖概率偏离名义置信度的现象。 β. Clopper-Pearson精确区间 Clopper-Pearson精确区间(Clopper-Pearson Exact Interval)构造非常直观,它直接基于二项分布的直接累积概率计算,通过“精确”的概率反推边界。换句话说,Clopper-Pearson精确区间的基本逻辑是寻找这样的p:使得观测到当前k(或更极端情况)的概率恰好等于显著性水平α,从而确定区间的上下边界。 ![img_12.png](/uploads/forum/20260730/daf2df1f78f6654a05a5b30f2123df66.png) 解上述两个方程我们就可以得到用F分布表达的关于PL和Pu的两个解(等价地也可以用Beta分布表示,在这里不列举): ![img_13.png](/uploads/forum/20260730/a4db4700e22dc94a45ff83ebb524b7b5.png) Clopper-Pearson精确区间被许多学者(如Boehning、Leemis、Trivedi)及多数统计教科书视为二项分布置信区间的“黄金标准”,这主要归因于其构造的直观性、逻辑上的合理性以及严格的“精确”性质。尤其是在小样本场景中,相比于依赖渐近近似的Wald方法,Clopper-Pearson方法通常表现更稳定、覆盖率更高,不易因样本量过小而出现明显失真。 然而,这一方法自身也存在明显局限。 根源在于二项分布本身是离散型分布,而Clopper-Pearson所构建的区间在覆盖概率上往往过于保守。具体来说,该方法所保证的置信水平是至少在设定水平(如95%)以上,导致实际覆盖率常常高于名义水平,进而使得区间宽度往往比必要范围更宽。这种过度保守的特性虽然在理论上确保了置信度,但在实际应用中可能会降低区间估计的信息量和效率,尤其在样本量不大时更为明显。 γ. Wilson得分区间(Wilson Score Interval) Wilson得分方法构造置信区间的原理在一定程度上和Wald方法是类似的,但是其最大的不同是Wald方法使用的方差是用样本估计出来的方差,而Wilson Score是基于得分检验(Score Test)并基于原假设的参数构造了置信区间。换句话说,Wilson得分区间的构造也是基于 ![img_14.png](/uploads/forum/20260730/36be775d6176bcefb48929eea3f372e8.png) 但是,方差的部分并没有基于通过样本估计出来的计算,而是直接使用了原假设的p本身。换一个角度说,Wald方法的方差是基于极大似然估计处的似然,而Wilson得分方法则是基于原假设参数处的似然。因此Wilson得分方法我们需要解的方程就是 ![img_15.jpg](/uploads/forum/20260730/860e9c68c1c9223613befb88c3b9a7b7.jpg) 而这个区间有解析解,也就是 ![img_16.png](/uploads/forum/20260730/56f7919465e23fb88b2034256f4d2a6d.png) 基于这个区间,我们可以发现这个区间的中点是 ![img_17.png](/uploads/forum/20260730/0da97aa458bc9dcba44bae625eebeb93.png) 这个中点可以被看作估计参数p̂和P=1/2的一个加权得到的结果,也就是说这个估计中,二项分布的参数通过样本量n以及0.5这个点进行了修正,并且当样本量n很小的时候会向0.5的方向进行修正,而当样本量n足够大的时候中点会收敛于p̂。如果我们把这个区间的中点看作是二项分布参数的一个估计,那么很明显它是有偏的但是是渐近无偏的。 如果进一步,我们把这个置信区间纳入正态分布构造置信区间的框架下,可以发现这个中点的方差是 ![img_18.png](/uploads/forum/20260730/aa177f693a92a4c4b75d27d87f068166.png) ## ## PART 3为什么选择Wilson得分区间? Alan Agresti和Brent A. Coull 1998年发表了一篇名为Approximate is Better than "Exact" for Interval Estimation of Binomial Proportion讨论了二项分布的参数区间估计为什么Wilson得分会优于其他经典方法的。而正式这篇论文的结论使得Wilson得分区间成为了关于二项分布置信区间的首选方法,接下来的部分我们将会讨论这篇论文中的核心思想。 在所有的理论开始之前,我们必须要理解关于置信区间的两个概念: ①名义置信水平(nominal confidence level) ②实际覆盖概率(actual coverage probability) 名义置信水平指的是在构造区间时,事先指定的置信系数,最常见的也就是大家都熟悉的。实际覆盖概率则指的是在给定参数θ以及一个区间,参数θ落入区间的概率 ![img_19.png](/uploads/forum/20260730/17668b47aa87acf65cf94b498ced6cf8.png) 而这个概率的下确界需要能够保证名义置信水平能够被保证,也就是说 ![img_20.png](/uploads/forum/20260730/b2f0e7b5e847e56a3dc62f74fc783e91.png) 理论上讲,实际覆盖概率的下确界应该是关于能够实现区间的“最坏”的情况。但是在实践中,一般会用“平均表现”来衡量这个实际覆盖概率。因此大多数情况下,实际覆盖概率描述的是在重复抽样时,该区间真正包含真实参数θ值的概率。 总的来说,名义置信水平是"声称的置信度",实际覆盖概率是"区间在重复抽样中真正包含参数的真实频率"。因此在一些情况下,二者不一定时相等的。 正是基于名义置信水平和实际覆盖概率在一定的情况下并不相等,Agresti et al.对上述三种方法构造的置信区间比较了名义置信水平和实际覆盖概率之间的差异。为了衡量实际覆盖概率,Agresti et al.构造了一个关于参数p的覆盖函数 ![img_21.png](/uploads/forum/20260730/2181c6f7c9fdd7015882a9abb7cf49ba.png) 其中I(K,P)是示性函数,当X=K时置信区间包含参数p则为1,否则为0。而为了计算区间覆盖的平均表现,那么一系列可能的p是必须的,然后根据这些p的结果的均值/期望便可以衡量区间的实际覆盖概率。 而Agresti和Coull采取了一种类似贝叶斯策略的做法:他们将这一系列可能的p看作来自于一个Beta分布g(x),而其“后天”期望(expectation a posteriori)则是实际覆盖概率的平均表现,即 ![img_22.png](/uploads/forum/20260730/5d81c5ee5dcf89d3d6da2035d26c775d.png) Agresti et al.关于g(x)重点研究了两种情况: 无信息的分布,也就是Beta(1, 1)(即0到1之间的均匀分布) 带有一定偏度的弱信息的分布,也就是Beta(3.5, 31.5)(期望为0.1,方差为0.05) 关于无信息的分布,在名义置信水平是0.95的时候,Agresti et al.在不同的样本量(n = 5, 15, 30, 50, 100)下,得到了如下的实际覆盖概率期望的计算结果: ![img_23.png](/uploads/forum/20260730/c3757d9988b63c425b0b93d5aa557c9f.png) 该表来自于Agresti et al. (1998), 结果得到的是不同n情况下的期望,而括号中则是对应RMSE 根据表中结果不难发现,在极小样本情形下(如 n = 5),Wilson 得分法展现出最优的性能:其实际覆盖概率为 0.955,非常接近名义置信水平 0.95,同时其 RMSE 仅为 0.029,是三种方法中最小的。这表明 Wilson 得分法在小样本下不仅保持了良好的覆盖精度,而且稳定性更高,波动更小。 相比之下,Clopper-Pearson 精确法虽然构造严谨、保证覆盖概率不低于名义水平,但在 n = 5 时其实际覆盖概率高达 0.990,明显超过 0.95,表现出前文指出过的保守性。这种保守性虽然在理论上确保了置信区间不会“漏掉”真实参数,但在实际应用中会导致区间过宽,降低估计的精确度。Wald 法则在 n = 5 时表现极差,其实际覆盖概率仅为 0.641,远低于名义水平 0.95,RMSE 高达 0.400,是三种方法中最不精确的。 随着样本量 n 的增加,三种方法的实际覆盖概率均逐渐向 0.95 收敛,但收敛速度与稳定性仍存在明显差异。从表中数据可见,无论 n 取何值(从 5 到 100),Wilson 得分法的实际覆盖概率始终最接近 0.95,且其 RMSE 始终保持最小。 例如,当 n = 100 时,Wilson 得分法的覆盖概率为 0.951,RMSE 仅为 0.008。Clopper-Pearson 精确法虽随样本量增加覆盖概率逐步下降并趋近于 0.95(如 n = 100 时为 0.965),但始终略高于名义水平,仍保持轻微保守性。而 Wald 法虽然在大样本下(如 n = 100)覆盖概率提升至 0.922,RMSE 降至 0.094,但仍未达到 0.95,且其收敛速度缓慢、波动仍较明显,说明其对样本量的依赖性强。 考虑到Wilson得分法中有通过p=1/2进行加权,对于Beta(1, 1)这种期望是0.5的分布可能是一种特殊的表现,Agrest et al.进一步尝试了弱信息的分布(这个情况下分布的均值是0.1)并将其和无信息的分布进行了对比,三种方法的表现如下图所示: image.png 图来自于Agresti et al. (1998) ![img_24.png](/uploads/forum/20260730/15ebe92c680f31d7e48d7284f599f12a.png) 图中E,S和W分别代表Clopper-Pearson精确法,Wilson得分法以及Wald方法 图(a)对应的是无信息的分布 图(b)则是弱信息的分布 不难发现,无论给定的关于p的分布如何,样本量如何变化,三种方法中Wilson得分依然是最好的、最接近于名义置信水平的。 从另一个角度看,在固定参数及冗余参数(nuisance parameter)的情况下,置信区间的宽度也是一个很好衡量置信区间表现的方法。Agresti et al.给出了样本量在n=15的时候,三种方法的置信区间宽度的期望。 我们可以看到在这种情况下Wilson得分法的宽度始终是比Clopper-Pearson精确法小,而当p接近于1或者接近于0的时候Wald方法虽然更窄,但是其置信区间的宽度趋近于0的性质没法避免。 ![img_25.png](/uploads/forum/20260730/f05a38f52fd0978b01623a6787194d5a.png) 图来自于Agresti et al. (1998) 但是不是所有情况下Wilson得分置信区间都是比Clopper-Pearson精确法更小的。在边界的情况,例如当k=0的时候,不难计算出样本量在的情况下Clopper-Pearson精确区间的宽度会小于Wilson得分区间的宽度。但是大多数情况下Wilson得分区间的宽度是比起Clopper-Pearson精确区间是更小的。 上文中我们提到Wald方法基于中心极限定理能够让构造区间的方差渐近收敛于Cramér-Rao下界,构造的区间应该是渐近最优的,因而在样本量足够大的情况下这个区间是比较小的。但是在一些情况下Wilson得分区间比Wald区间更小,这是因为Cramér-Rao下界的条件中包含了无偏估计这个前提条件,而Wilson得分区间的构造方法是基于渐近无偏的估计量,所以在相同的依赖正态分布的方法的基础上,某些情况下能够构造出更小的置信区间。如果把这两个点估计看作模型的零模型的截距项,那么这种思想和模型建立中bias-variance trade-off的思想是相通的。这种通过有偏估计构造置信区间思想也产生了其他一些方法,比如使用Jeffrey's prior的方法,在此不赘述。 尽管Wilson得分法在上述方法对比中有着最好的表现,但是Wilson得分区间实际上也牺牲了一部分性质。首先便是Wilson得分区间不是“精确的”,它不能够保证这个区间的下确界能够大于名字置信水平。 比如当p特别接近0或者1的时候,实际的覆盖区间会变得特别小。例如名义置信水平是0.95的时候,p=0.018且n=10的情况下覆盖只有0.835。但是Agresti et al.也表明,当样本量n>20的时候,Wilson得分区间的实际覆盖概率低于 0.90 的参数空间比例不超过 1%。并且与Clopper-Pearson精确区间相比,Wilson得分区间的覆盖概率落在名义水平 范围内的参数值比例要高得多。而且在各个样本量下,在整个参数空间中,有超过 90% 的真值 p,Wilson得分区间的覆盖概率比Clopper-Pearson精确区间的覆盖概率更接近0.95。 参考文献: [1] Agresti, A., & Coull, B. A. (1998). Approximate Is Better than “Exact” for Interval Estimation of Binomial Proportions. The American Statistician, 52(2), 119–126. [2] Edwardes, M., & Vollset, S. (1994). Confidence intervals for a binomial proportion by S. E. Vollset, Statistics in Medicine, 12, 809-824 (1993). Statistics in medicine, 13 16, 1693-8 .

评论 0

回到顶部