摘要
本文介绍了 Microsoft Office Excel 2003 和 Microsoft Office Excel 2007 中的 CONFIDENCE 函数,说明了该函数的使用方式,并将 Excel 2003 和 Excel 2007 的函数结果与早期版本的 Excel 中的 CONFIDENCE 结果进行了比较。
置信区间的含义经常被误解,我们尝试解释在您从数据中确定置信度值后可以做出的有效和无效陈述。
详细信息
CONFIDENCE (alpha、sigma、n) 函数返回一个值,可用于构造总体平均值的置信区间。 置信区间是以已知样本平均值为中心的值范围。 假设样本中的观测值来自具有已知标准差、sigma 的正态分布,并且样本中的观测值数为 n。
语法
CONFIDENCE(alpha,sigma,n)
参数:Alpha 是概率,0 < 为 alpha < 1。 Sigma 是一个正数,n 是一个正整数,对应于样本量。
通常,alpha 是一个很小的概率,例如 0.05。
用法示例
假设智商 (智商) 分数遵循标准差为 15 的正态分布。 您测试当地学校 50 名学生样本的智商,并得到样本平均值 105。 您需要计算总体平均值的 95% 置信区间。 95% 或 0.95 置信区间对应于 alpha = 1 – 0.95 = 0.05。
若要说明 CONFIDENCE 函数,请创建一个空白 Excel 工作表,复制下表,然后在空白 Excel 工作表中选择单元格 A1。 在“编辑”菜单上,单击“粘贴”。
注意
在 Excel 2007 中,单击“开始”选项卡上“剪贴板”组中的“粘贴”。
下表中的条目将填充工作表中的单元格 A1:B7。
| alpha | 0.05 |
|---|---|
| stdev | 15 |
| n | 50 |
| 样本平均值 | 105 |
| =CONFIDENCE (B1,B2,B3) | |
| =NORMSINV (1 - B1/2) *B2/SQRT (B3) |
将此表粘贴到新的 Excel 工作表中后,单击“ 粘贴选项 ”按钮,然后单击“ 匹配目标格式”。
在粘贴区域仍处于选中状态的情况下,指向“格式”菜单上的“列”,然后单击“自动调整所选内容”。
注意
在 Excel 2007 中,选中粘贴的单元格区域后,单击“开始”选项卡上“单元格”组中的“格式”,然后单击“自动调整列宽”。
单元格 A6 显示 CONFIDENCE 的值。 单元格 A7 显示相同的值,因为调用 CONFIDENCE (alpha、sigma、n) 返回计算结果:
NORMSINV(1 – alpha/2) * sigma / SQRT(n)
没有直接对 CONFIDENCE 进行任何更改,但在 Microsoft Excel 2002 中改进了 NORMSINV,随后在 Excel 2002 和 Excel 2007 之间进行了更多改进。 因此,CONFIDENCE 可能会在这些较高版本的 Excel 中返回不同的 (和改进的) 结果,因为 CONFIDENCE 依赖于 NORMSINV。
这并不意味着你应该对早期版本的 Excel 的 CONFIDENCE 失去信心。 NORMSINV 中的不准确通常发生在非常接近 0 或非常接近 1 的参数值时。 实际上,alpha 通常设置为 0.05、0.01 或 0.001。 alpha 值必须小于该值(例如 0.0000001),然后才可能注意到 NORMSINV 中的舍入误差。
注意
有关 NORMSINV 中计算差异的讨论,请参阅有关 NORMSINV 的文章。
有关更多信息,请单击下面的文章编号,以查看 Microsoft 知识库中相应的文章:
826772 Excel 统计函数:NORMSINV
CONFIDENCE结果解读
CONFIDENCE 的 Excel 帮助文件已针对 Excel 2003 和 Excel 2007 进行了重写,因为所有早期版本的帮助文件在解释结果方面都提供了误导性建议。 该示例指出,“假设我们观察到,在 50 名通勤者的样本中,平均上班时间为 30 分钟,总体标准差为 2.5。 我们可以有 95% 的信心总体平均值位于区间 30 +/- 0.692951“,其中 0.692951 是置信度返回的值 (0.05、2.5、50) 。
对于同一个例子,结论是,“平均上班时间等于 30 ± 0.692951 分钟,即 29.3 至 30.7 分钟。据推测,这也是关于总体平均值落在区间 [30 – 0.692951, 30 + 0.692951] 内的陈述,概率为 0.95。
在进行产生本示例数据的实验之前,与贝叶斯统计学家相比,经典统计学家 () 不能对总体平均值的概率分布做出任何陈述。 相反,经典统计学家处理假设检验。
例如,经典统计学家可能想要进行双侧假设检验,该分布基于正态分布的假设,该分布具有已知标准差 ((例如 2.5) )、总体平均值的特定预选值 μ0 和预选显着性水平 ((例如 0.05) )。 检验的结果将基于观察到的样本平均值 (例如 30) ,如果观察到的样本平均值在任一方向上都离 μ0 太远,则总体平均值为 μ0 的零假设将在显着性水平 0.05 处被拒绝。 如果零假设被拒绝,则解释是,在假设 μ0 是真实总体平均值的情况下,远离 μ0 的样本平均值将在不到 5% 的时间内偶然发生。 在进行此测试后,经典统计学家仍然无法对总体平均值的概率分布做出任何陈述。
另一方面,贝叶斯统计学家会从总体平均值的假设概率分布开始, (命名为先验分布) ,将以与经典统计学家相同的方式收集实验证据,并使用该证据来修改她或他的总体平均值的概率分布,从而获得后验分布。 Excel 没有提供任何统计函数来帮助贝叶斯统计学家完成这项工作。 Excel 的统计函数都是为传统统计学家准备的。
置信区间与假设检验相关。 给定实验证据,置信区间对假设的总体平均值 μ0 的值做出了简明的陈述,该值将产生对总体平均值为 μ0 的零假设的接受,以及 μ0 的值将产生对总体平均值为 μ0 的零假设的拒绝。 经典统计学家不能对总体平均值在任何特定区间内下降的可能性做出任何陈述,因为他或她从不对这种概率分布做出先验假设,如果要使用实验证据来修改它们,就需要这样的假设。
使用本节开头的示例探索假设检验和置信区间之间的关系。 使用上一节中所述的 CONFIDENCE 和 NORMSINV 之间的关系,您有:
CONFIDENCE(0.05, 2.5, 50) = NORMSINV(1 – 0.05/2) * 2.5 / SQRT(50) = 0.692951
由于样本均值为 30,因此置信区间为 30 +/- 0.692951。
现在考虑一个有意性水平为 0.05 的双侧假设检验,如前所述,该检验假设正态分布为标准差 2.5、样本量为 50 和特定假设的总体平均值 μ0。 如果这是真正的总体平均值,则样本平均值将来自总体平均值 μ0 和标准差的正态分布,2.5/SQRT (50) 。 该分布对 μ0 是对称的,如果 ABS (样本均值 - μ0) > 一些截止值,则需要拒绝原假设。 临界值将是这样的,如果 μ0 是真正的总体平均值,则样本平均值 - 高于此临界值的 μ0 或高于此临界值的 μ0 – 高于此临界值的样本均值将以 0.05/2 的概率分别发生。 此截止值为
NORMSINV(1 – 0.05/2) * 2.5/SQRT(50) = CONFIDENCE(0.05, 2.5, 50) = 0. 692951
因此,如果以下陈述之一为真,则拒绝原假设 (总体均值 = μ0) :
样本平均值 - μ0 > 0。 692951
0 – 样本平均值 > 0。 692951
由于示例中示例平均值 = 30,因此这两个语句将成为以下语句:
30 - μ0 > 0. 692951
μ0 – 30 > 0. 692951
重写它们以便仅在左侧出现 μ0 会产生以下语句:
μ0 < 30 - 0. 692951
μ0 > 30 + 0。 692951
这些值正是不在置信区间 [30 – 0.692951, 30 + 0.692951] 中的 μ0 值。 因此,置信区间 [30 – 0.692951, 30 + 0.692951] 包含那些 μ0 值,其中给定样本证据,总体平均值为 μ0 的零假设不会被拒绝。 对于超出此区间的 μ0 值,给定样本证据,总体平均值为 μ0 的零假设将被拒绝。
结束语
早期版本的 Excel 通常发生在 NORMSINV (p) 中极小或极大的 p 值时。 通过调用 NORMSINV (p) 来评估 CONFIDENCE,因此 NORMSINV 的准确性是 CONFIDENCE 用户可能关心的问题。 但是,在实践中使用的 p 值不太可能极端到导致 NORMSINV 中出现明显的舍入误差,任何版本的 Excel 的用户都不应担心 CONFIDENCE 的性能。
本文的大部分内容都集中在解释 CONFIDENCE 的结果上。 换句话说,我们问过,“置信区间的含义是什么?置信区间经常被误解。 遗憾的是,所有早于 Excel 2003 的 Excel 版本中的 Excel 帮助文件助长了这种误解。 Excel 2003 帮助文件已得到改进。