正規化(Regularization)
摘要
正規化(regularization)指在模型學習過程中引入額外限制(constraints)或偏好(preferences),使模型傾向選擇特定類型的解(solutions)。其核心目的並非單純降低訓練誤差,而是在多個可能解之間控制模型的複雜度(model complexity)與穩定性(stability)。
在機器學習(machine learning)中,訓練資料通常不足以唯一決定最佳模型,因此模型可能存在大量能擬合資料但泛化能力不同的解。正規化的作用即是在這些候選解之間引入結構偏好(structural bias),使模型傾向選擇較平滑、較簡單或較穩定的表示形式。
因此正規化本質上是一種歸納偏好(inductive bias),其角色不是改變資料,而是限制模型在假設空間(hypothesis space)中的自由度。
基本形式
正規化通常與損失函數(loss function)共同構成整體學習目標:
其中 負責資料擬合,而 則負責施加結構限制。參數 用於控制模型對資料與結構偏好的權衡。
L2 正規化(L2 regularization)透過限制參數大小,使模型傾向形成平滑解(smooth solutions);L1 正規化(L1 regularization)則促使部分參數趨近於零,形成稀疏表示(sparse representations)。
除了參數懲罰外,正規化亦可透過限制模型結構完成。例如參數共享(parameter sharing)、模型深度限制與低秩結構(low-rank structures)等方法,皆屬於對可表示函數空間(function space)的直接限制。
隨機化方法(stochastic regularization)則在訓練過程中引入擾動。Dropout 透過隨機移除部分神經元,使模型無法依賴單一路徑進行預測,從而學得更穩定的表示。
泛化與模型行為
正規化的核心效果在於改變模型偏好的解空間幾何(solution-space geometry)。當模型自由度受到限制時,其對訓練資料噪聲的敏感度會降低,因此更容易形成具有泛化能力(generalization)的穩定解。
從更一般的視角來看,正規化可視為在學習過程中引入先驗假設(prior assumptions)的機制。不同正規化方法代表不同的結構假設,例如平滑性、稀疏性、局部穩定性或低複雜度。
因此正規化不僅是避免過擬合的技術工具,也是模型如何形成偏好與建立歸納能力(inductive capability)的核心機制。
