貝葉斯推論(Bayesian Inference)
摘要
貝葉斯推論(Bayesian inference)是一種以機率分佈(probability distributions)表達知識狀態與不確定性(uncertainty)的推論框架。其核心思想不是直接尋找單一固定答案,而是根據觀測資料(observed data)持續更新對參數、狀態或假設的信念(beliefs),使推論結果以後驗分佈(posterior distribution)的形式呈現。
與頻率學派(frequentist statistics)將參數視為固定未知量不同,貝葉斯方法將參數視為隨機變數(random variables),並以先驗分佈(prior distribution)描述觀測前的假設,以似然函數(likelihood)描述資料在給定假設下的合理性,再以後驗分佈描述更新後的信念。其核心結構由貝葉斯定理(Bayes' theorem)給出:
其中 為先驗分佈, 為似然函數, 為證據(evidence), 為後驗分佈。這一結構使貝葉斯推論成為一種將資料、先驗知識與不確定性統一處理的形式化框架。
分佈結構
先驗分佈(Prior Distribution)
先驗分佈描述在觀測資料之前,對參數或狀態的既有假設。它不是額外裝飾,而是推論問題的一部分,因為在資料不足或噪聲較大時,先驗會明顯影響結果。先驗的作用在於限制解空間,將模型偏好引入推論過程。
似然函數(Likelihood)
似然函數描述在給定參數下,資料出現的合理性。它不是資料本身的分佈,而是從參數角度看資料的支持程度。就學習問題而言,似然函數是連接模型與資料的核心橋樑,因為它直接刻畫「哪些參數能更好地解釋資料」。
證據(Evidence)
證據項 是後驗分佈的正規化常數,用來確保後驗仍是一個合法分佈。雖然它在參數比較時常可忽略,但在模型比較、邊際似然與貝葉斯模型選擇中具有關鍵作用。證據也使貝葉斯推論不只是局部擬合,而是包含整體模型支持度的框架。
後驗分佈(Posterior Distribution)
後驗分佈是貝葉斯推論的核心輸出,表示在觀測資料之後,對參數或狀態的新信念。它不是單一估計值,而是一個完整分佈,因此能保留不確定性資訊。從這個角度看,貝葉斯推論不是把不確定性消除,而是把不確定性形式化。
估計與推論
最大似然估計(Maximum Likelihood Estimation, MLE)
MLE 只考慮資料擬合,其目標是找出最能解釋觀測資料的參數:
它可以視為不引入先驗時的估計方式,因此是貝葉斯推論中的特殊情況。MLE 強調資料本身的支持力,但不直接表達對解空間的偏好。
最大後驗估計(Maximum A Posteriori, MAP)
MAP 透過最大化後驗分佈,在資料擬合與先驗偏好之間取得平衡:
若將貝葉斯定理代入,可得:
因此 MAP 可理解為「在資料支持下,選擇最符合先驗偏好的解」。當先驗為均勻分佈時,MAP 退化為 MLE。這使 MAP 成為貝葉斯推論與正則化之間的重要接口。
貝葉斯估計(Bayesian Estimation)
貝葉斯估計不一定只選擇單一最優參數,而是直接使用後驗分佈做決策。其核心觀點是:若不確定性本身是重要資訊,就不應過早將分佈壓縮成單一點估計。這使貝葉斯估計比 MLE 與 MAP 更完整,但也通常更依賴後續的決策準則。
後驗近似
變分推論(Variational Inference, VI)
許多真實問題中的後驗分佈難以直接計算,因此需要近似方法。變分推論的思想是:以一個較簡單的分佈族近似真實後驗,並透過最佳化使兩者差異最小。這使原本的積分或抽樣問題轉化為可求解的最佳化問題。
馬可夫鏈蒙地卡羅(Markov Chain Monte Carlo, MCMC)
MCMC 透過構造抽樣過程來近似後驗分佈。其核心不是尋找閉式解,而是讓樣本分佈在長期上逼近目標分佈。與變分推論相比,MCMC 更接近直接計算後驗,但通常計算成本更高。
後驗近似的意義
後驗近似說明貝葉斯推論的本質不是單一公式,而是對分佈的計算、逼近與操作。當精確後驗不可得時,推論問題就變成如何在可計算性與準確性之間取得平衡。
不確定性
預測不確定性(Predictive Uncertainty)
預測不確定性描述模型對未來輸出的不確定程度。模型不只要給出預測,還要能反映自身對預測的信心。這一點使貝葉斯方法特別適合資料不足、噪聲較大或風險敏感的情境。
認知不確定性(Epistemic Uncertainty)
認知不確定性來自模型知識不足,通常可透過更多資料或更好模型降低。它反映的是「模型不知道的部分」,因此與推論品質密切相關。
隨機不確定性(Aleatoric Uncertainty)
隨機不確定性來自資料本身的噪聲或生成機制,通常無法靠增加模型知識完全消除。它反映的是問題本身的內在變異,而不是模型能力不足。
不確定性在貝葉斯框架中的角色
貝葉斯推論的價值不只在於預測準確度,更在於將不確定性顯式保留下來。這使模型可以表達「知道」與「不知道」的差異,而不是把所有情況都壓縮成同一種確定性輸出。
資訊與學習
資訊熵(Information Entropy)
資訊熵描述機率分佈的不確定程度。當貝葉斯推論以分佈作為核心表示時,熵自然成為衡量信念狀態散佈程度的重要工具。它刻畫的是分佈本身的可預測性,而不是語意內容。
KL 散度(KL Divergence)
KL 散度衡量兩個分佈之間的差異,是貝葉斯近似推論中的核心量。變分推論之所以成立,本質上就是在最小化近似分佈與真實後驗之間的 KL 差異。KL 散度因此連接了資訊論與機率推論。
交叉熵(Cross Entropy)
交叉熵用來度量一個分佈對另一個分佈的編碼代價,也常作為分類模型中的學習目標。從貝葉斯角度看,它與似然、KL 散度和熵之間存在緊密對應,因此是機率推論進入機器學習實作的關鍵接口。
決策與行為
Bayesian Decision Theory
貝葉斯決策理論關心的不是單純的參數估計,而是在後驗分佈下如何做出最優決策。它將機率推論與損失函數、效用函數(utility)結合,使推論結果能直接服務於行動選擇。
機率行動(Probabilistic Action)
在某些系統中,輸出不應被簡化為單一決策,而應保留為行動分佈。這使系統在不確定環境下能更靈活地進行選擇,也使推論與行為之間維持連續關係。
策略(Policy)
策略可以視為在不確定性下的行為規則。從貝葉斯觀點看,策略不只是輸出映射,而是對機率信念的決策化表達。這使貝葉斯推論不只停留在估計層,也延伸到行為層。
結語
貝葉斯推論的本質,是以機率分佈作為知識與不確定性的表示形式,並透過資料不斷更新信念結構。它把先驗、似然、後驗、估計、近似、不確定性與決策統一在同一個形式化框架之中,因此不只是統計方法,而是機器學習與推論系統的基礎骨架。