最佳化(Optimization )
摘要
最佳化方法(optimization methods)指在給定學習目標(learning objective)的情況下,模型如何於參數空間(parameter space)中搜尋可行解(feasible solutions)的運算策略。在機器學習(machine learning)中,損失函數(loss function)定義模型應達成的目標,而最佳化方法則決定模型如何逐步逼近該目標。
因此最佳化不負責定義「什麼是好的解」,而是負責決定「如何找到解」。核心問題並非表示學習(representation learning)本身,而是高維參數空間中的搜尋動態(search dynamics)。
在模型學習流程中,損失函數定義目標,正規化(regularization)限制解空間,而最佳化方法則負責在此限制下更新模型參數:
因此最佳化方法本質上是一種搜尋機制(search mechanism),角色是控制模型如何在複雜損失地形(loss landscape)中移動。
基本形式
梯度法(gradient-based methods)是最常見的最佳化方法,核心思想為利用損失函數對參數的梯度(gradient)決定更新方向。由於梯度描述局部上升最快方向,因此參數通常沿梯度反方向移動,以降低損失函數值:
其中 為學習率(learning rate),控制每次更新步長。
根據每次更新使用的資料量,可分為批次梯度下降(batch gradient descent)、隨機梯度下降(stochastic gradient descent, SGD)與小批次梯度下降(mini-batch gradient descent)。此類方法之間的差異,本質上反映計算穩定性與估計噪聲之間的權衡。
動量方法(momentum-based methods)則透過累積歷史梯度,使參數更新具有慣性(inertia)。此類方法可降低震盪並加速穿越平坦區域,因此能改善高維空間中的搜尋效率。
自適應最佳化(adaptive optimization)則根據歷史梯度資訊動態調整不同參數的學習率。Adam(Adaptive Moment Estimation)結合動量與自適應尺度調整,因此成為深度學習(deep learning)中最常見的最佳化方法之一;RMSProp 則透過調整梯度尺度,使不同維度的更新保持平衡。
搜尋幾何與模型行為
從幾何角度來看,最佳化方法描述模型如何在損失函數所形成的地形(loss landscape)中移動。梯度提供局部方向資訊,而最佳化方法則決定移動速度、路徑穩定性與歷史資訊的使用方式。
不同最佳化方法對應不同搜尋軌跡(optimization trajectories),因此即使損失函數相同,模型仍可能收斂至不同解。這種差異不僅影響收斂速度(convergence rate),也會影響模型最終的泛化能力(generalization)與表示結構(representation structure)。
從更一般的視角來看,最佳化方法可視為高維空間中的搜尋策略(search strategies)。設計反映對問題結構的假設,例如局部梯度是否可靠、不同參數是否具有不同尺度,以及歷史方向是否能幫助預測未來更新方向。因此最佳化方法不僅是數值計算工具,也是模型學習行為(learning dynamics)的核心組成部分。

