資訊熵(Information Entropy)
摘要
資訊熵(information entropy)是對機率分佈不確定性(uncertainty)的量化方式,其核心目的在於描述系統狀態的可預測程度(predictability)。在資訊論(information theory)中,熵不描述事件本身的語意內容,而描述觀測前系統可能狀態的分佈結構。
當機率分佈高度集中時,系統狀態接近確定,因此觀測所帶來的新資訊有限;當機率分佈較為分散時,系統狀態難以預測,因此觀測將帶來較大的資訊變化。
因此,不確定性並非單一事件的屬性,而是整體機率分佈的性質。資訊熵的核心作用,即是將此種分佈結構形式化為可量化的數學對象。
形式化
對於隨機變數 ,Shannon 熵定義為:
其中每一項機率 代表事件發生的可能性,而對數項則描述該事件對不確定性的貢獻程度。
當分佈接近均勻時,各事件具有相近機率,因此系統狀態較難預測,熵值較高;當機率集中於少數事件時,多數結果已接近可確定,熵值則降低。
此定義僅依賴機率分佈本身,而不依賴事件的物理意義或語意內容,因此熵可作為一般性的分佈不確定性度量。
資訊與分佈變化
在資訊論框架下,資訊(information)不再被視為語意內容,而被理解為對不確定性的改變。觀測前,系統具有某種分佈結構;觀測後,部分可能性被排除,使分佈收縮,因此不確定性下降。
機率較低的事件之所以具有較高資訊量,是因為此類事件的發生會顯著改變原先分佈的預期結構。反之,若事件本身已高度可預測,則觀測後的分佈幾乎不變,因此資訊量較低。
因此資訊可被理解為對分佈結構的修正(distributional update),而熵則描述此分佈在觀測前所具有的不確定程度。
在學習中的角色
在機器學習(machine learning)中,模型輸出通常表現為機率分佈,因此熵可直接用於描述模型的不確定性。當模型輸出集中於單一類別時,表示模型具有較高確定性;當輸出接近均勻分佈時,則表示模型難以區分不同可能結果。
因此熵不僅是資訊論中的理論量,也構成現代學習系統中的核心描述工具。交叉熵(cross-entropy)、KL 散度(Kullback–Leibler divergence)與最大熵原理(maximum entropy principle)等方法,皆建立在對機率分佈結構的度量之上。
從更一般的視角來看,資訊熵可視為對分佈可預測性的幾何描述,其角色是將資訊、學習與推論統一於機率分佈的形式化框架之中。


