評估指標(Evaluation Metrics)
定義與角色
評估指標(evaluation metrics)用於量化模型在資料上的預測表現,將模型輸出與真實標籤之間的差異轉換為可比較的數值。相較於損失函數(loss function)服務於模型訓練與優化,評估指標主要用於模型比較、選擇與結果解讀。
不同任務類型對應不同指標結構,其中回歸問題(regression)與分類問題(classification)在評估方式上具有本質差異。
回歸指標(Regression Metrics)
回歸指標衡量連續數值預測與真實值之間的誤差結構,重點在於誤差大小與分佈特性。
Mean Absolute Error(MAE)衡量預測誤差的絕對值平均,對極端值(outliers)相對穩健:
Mean Squared Error(MSE)對誤差進行平方後取平均,使較大誤差被放大:
Root Mean Squared Error(RMSE)為 MSE 的平方根,使單位回到原始尺度:
R-squared(,決定係數)衡量模型對資料變異的解釋能力:
該指標反映模型相對於平均預測的改善程度,而非單純誤差大小。
分類指標的基礎結構(Confusion Matrix)
分類問題的評估建立在混淆矩陣(confusion matrix)之上,其將預測結果拆解為四種情況:
TP(True Positive)
FP(False Positive)
TN(True Negative)
FN(False Negative)
其中 True / False 表示預測是否正確,Positive / Negative 表示樣本的實際類別。所有常見分類指標皆由此結構推導而來。
基於混淆矩陣的指標
Precision(精確率)描述被預測為正類的樣本中實際為正類的比例:
Recall(召回率,Sensitivity)描述實際為正類的樣本中被正確預測的比例:
F1 Score 為 Precision 與 Recall 的調和平均,用於平衡兩者之間的權衡:
Accuracy(準確率)衡量整體預測正確的比例:
當資料存在類別不平衡(class imbalance)時,Accuracy 可能失去解釋力,因此需結合其他指標使用。
排序與閾值無關指標(Ranking-based Metrics)
部分指標不依賴單一分類閾值,而是考慮模型在不同決策邊界下的整體表現。
ROC 曲線(Receiver Operating Characteristic)以 True Positive Rate(TPR)與 False Positive Rate(FPR)構成,描述模型在不同閾值下的分類能力。
AUC(Area Under Curve)為 ROC 曲線下面積,用單一數值量化模型區分正負樣本的能力,其範圍為 。數值越高,表示模型在不同閾值下均具有較好的區分能力。
Top-k 指標
Top-k Accuracy 用於多分類問題,判斷真實標籤是否落在模型預測機率最高的前 個類別之中。
當 增大時,模型的容錯空間提高,該指標常用於大規模分類任務(例如影像分類),以補足單一預測(Top-1)過於嚴格的限制。
指標選擇的結構性考量
評估指標的選擇取決於任務目標與錯誤成本結構。回歸問題關注誤差的數值尺度與分佈特性,而分類問題則需考慮不同錯誤型態之間的權衡關係。
當問題涉及不平衡資料、排序需求或多分類結構時,單一指標通常不足以完整描述模型性能,需透過多指標組合進行評估。


