摘要
本文描述 Microsoft Office Excel 2003 與 Microsoft Office Excel 2007 中的 CONFIDENCE 函數,說明該函數的使用方式,並將 Excel 2003 與 Excel 2007 的函數結果與早期版本 Excel 中 CONFIDENCE 的結果做比較。
信賴區間的意義經常被誤解,我們嘗試解釋有效與無效的陳述,這些陳述在你從資料中確定信心值後可以做出。
更多資訊
信心 (α、sigma、n) 函數會回傳一個數值,可以用來構建母體平均值的信賴區間。 信賴區間是一個以已知樣本平均值為中心的數值範圍。 樣本中的觀測值假設來自一個已知標準差為 sigma 的常態分布,且樣本中觀測值為 n。
語法
CONFIDENCE(alpha,sigma,n)
參數:Alpha 為機率, < 0 為 alpha < 1。 Sigma 是一個正數,n 是一個正整數,對應於樣本大小。
通常,alpha 是一個很小的機率,例如 0.05。
使用範例
假設智商 (智商) 分數遵循標準差15的常態分布。 你在當地學校對50名學生進行智商測試,並取得平均105的樣本。 你要計算母體平均值的95%信賴區間。 95%或0.95信賴區間對應α=1–0.95=0.05。
為了說明 CONFIDENCE 函數,請建立一張空白的 Excel 工作表,複製以下表格,然後在空白的 Excel 工作表中選擇儲存格 A1。 在 [編輯] 功能表上,按一下 [貼上]。
注意
在 Excel 2007 中,點擊「貼上」在主頁分頁的剪貼簿群組。
下表中的項目會填滿你工作紙中的A1:B7格子。
| 阿爾法 | 0.05 |
|---|---|
| STDEV | 15 |
| n | 50 |
| 樣本平均數 | 105 |
| =信心 (B1、B2、B3) | |
| =NORMSINV (1 - B1/2) *B2/SQRT (B3) |
將此表格貼上到新的 Excel 工作表後,點擊 「貼上選項 」按鈕,然後點 選「匹配目的地格式」。
在仍選擇已貼上的範圍時,在格式選單中指向欄位,然後點選自動擬合選擇。
注意
在 Excel 2007 中,選取貼上的儲存格範圍後,在主頁標籤的儲存格群組中點選「格式化」,然後點選「自動貼合欄位寬度」。
A6 格顯示信心值。 A7 儲存格顯示相同值,因為呼叫 CONFIDENCE (alpha, sigma, n) 會回傳計算結果:
NORMSINV(1 – alpha/2) * sigma / SQRT(n)
CONFIDENCE 沒有直接做任何修改,但 Microsoft Excel 2002 中改進了 NORMSINV,之後在 Excel 2002 與 Excel 2007 之間又做了更多改進。 因此,CONFIDENCE 在這些後續版本的 Excel 中可能會回傳不同的 (與更佳的) 結果,因為 CONFIDENCE 依賴 NORMSINV。
這並不代表你應該對早期版本的 Excel 失去信心。 NORMSINV 的不準確通常發生在其參數值非常接近 0 或非常接近 1 時。 實務上,alpha 通常設為 0.05、0.01,或許是 0.001。 α 的值必須遠小於此,例如 0.0000001,NORMSINV 的捨入誤差才可能被察覺。
注意
關於 NORMSINV 計算差異的討論,請參見 NORMSINV 的條目。
如需詳細資訊,請按一下下面的文章編號,檢視「Microsoft 知識庫」中的文章:
826772 Excel 統計函數:NORMSINV
信心結果的解讀
CONFIDENCE 的 Excel 說明檔已重寫以適用於 Excel 2003 及 Excel 2007,因為早期版本的說明檔案在結果解讀上提供了誤導性的建議。 範例中指出:「假設我們觀察到,在我們50名通勤者的樣本中,平均通勤時間為30分鐘,人口標準差為2.5。 我們可以有95%的把握,母體平均值位於30 +/- 0.692951“區間,其中0.692951是置信度回傳的值 (0.05、2.5、50) 。
同一例子,結論寫道:「上班的平均通勤時間等於30±0.692951分鐘,或29.3到30.7分鐘。」推測這也是關於母體平均值落在區間 [30 – 0.692951, 30 + 0.692951] 內的機率為 0.95 的陳述。
在進行產生此範例資料的實驗之前,經典統計學家 (與貝葉斯統計學家) 無法對母體平均值的機率分布做出任何陳述。 相反地,傳統統計學家處理的是假設檢驗。
例如,經典統計學家可能想進行雙邊假設檢定,基於假設一個常態分布,標準差 (為2.5) 、特定預先選擇的母體平均值μ0,以及預選顯著水準 (如0.05) 。 檢定結果基於觀察到的樣本平均值 (例如30) ,若樣本平均值在任一方向都偏離μ0過遠,則在顯著水準0.05時,該虛無假設將被拒絕。 若排除虛無假設,則解釋為,若假設 μ0 為真實母體平均數,樣本平均數距離 μ0 如此遠或更遠的機率將低於 5%。 完成此檢驗後,經典統計學家仍無法對母體平均值的機率分布做出任何陳述。
另一方面,貝葉斯統計學家會從母體平均數的假設機率分布開始, (命名為先驗分布) ,並以與經典統計學家相同的方式收集實驗證據,並利用這些證據修正母體平均值的機率分布,從而得到後驗分布。 Excel 沒有提供任何統計函數,無法幫助貝葉斯統計學家完成這項工作。 Excel 的統計函數皆為傳統統計學家設計。
信賴區間與假設檢定相關。 根據實驗證據,信賴區間簡明扼要地陳述假設母體平均數 μ0 的值,從而接受母體平均為 μ0 的虛無假設,以及反駁母體平均為 μ0 的虛無假設的 μ0 值。 古典統計學家無法對母體平均值在任何特定區間內落下的機率做出任何陳述,因為他們從未對此機率分布做出先驗假設,而若用實驗證據修正這些假設,則需要這些假設。
請利用本節開頭的範例,探討假設檢定與信賴區間之間的關係。 根據上一節所述信心與 NORMSINV 之間的關係,你有:
CONFIDENCE(0.05, 2.5, 50) = NORMSINV(1 – 0.05/2) * 2.5 / SQRT(50) = 0.692951
由於樣本平均值為30,信賴區間為30 +/- 0.692951。
現在考慮一個顯著水準為0.05的雙側假設檢定,如前所述,假設常態分布標準差為2.5,樣本數為50,且假設母體平均值為μ0。 若此為真實母體平均數,則樣本平均數將來自母體平均數為 μ0、標準差為 2.5/SQRT (50) 的常態分布。 這個分布在 μ0 附近是對稱的,如果 ABS (樣本平均值 - μ0) > 某個截斷值,你就要拒絕虛無假設。 截斷值會使得如果 μ0 是真實的母體平均值,則樣本平均值 - 高於此截斷值的 μ0 或 μ0 - 樣本平均值高於此截斷值的值,機率會以 0.05/2 分別出現。 此截斷值為
NORMSINV(1 – 0.05/2) * 2.5/SQRT(50) = CONFIDENCE(0.05, 2.5, 50) = 0. 692951
因此,若以下陳述之一為真,則拒絕虛無假設 (母體平均 = μ0) :
樣本平均數 - μ0 > 0。 692951
0 – 樣本平均 > 數 0。 692951
由於範例平均數 = 30,這兩個陳述變成以下陳述:
30 - μ0 > 0。 692951
μ0 – 30 > 0。 692951
將它們重寫為僅 μ0 出現在左側,會得到以下陳述:
μ0 < 30 - 0。 692951
μ0 > 30 + 0。 692951
這些正是不在信賴區間 [30 – 0.692951, 30 + 0.692951] 的 μ0 值。 因此,信賴區間 [30 – 0.692951, 30 + 0.692951] 包含那些在樣本證據下,不會拒絕虛無假設(母體平均為 μ0)的 μ0 值。 對於 μ0 值超出此區間,基於樣本證據,則拒絕母體平均為 μ0 的虛無假設。
結論
早期版本的 Excel 通常會出現在 NORMSINV (p) 中 p 值極小或極大時出現不準確。 CONFIDENCE 的評估方式是將 NORMSINV (p) ,因此 NORMSINV 的準確性對 CONFIDENCE 使用者來說可能是一個關注點。 然而,實務中使用的 p 值不太可能極端到導致 NORMSINV 出現顯著的捨入誤差,且任何版本 Excel 使用者都不應擔心信心的效能。
本文大部分內容著重於解讀信心的結果。 換句話說,我們問道:「信賴區間的意義是什麼?」信賴區間常被誤解。 不幸的是,所有版本中 Excel 說明檔(早於 Excel 2003)都加深了這種誤解。 Excel 2003 說明檔案已有所改進。