決策機制(Decision Mechanism)
摘要
決策機制(decision mechanism)指模型如何將連續表示(continuous representations)或機率分佈(probability distributions)轉換為最終預測(prediction)或行動(action)的運算結構。在機器學習(machine learning)系統中,此步驟代表從表示(representation)到實際輸出的最後轉換。
模型本身通常輸出數值或機率,而非真正的決策結果。決策機制的作用在於根據這些候選結果進行選擇、抽樣或策略生成,使模型能與外部任務形成具體對應。
因此在典型流程中:
表徵映射(representation mapping)負責形成內部表示,機率映射(probability mapping)負責表達不確定性,而決策機制則負責將機率結構轉換為最終輸出。
基本形式
確定性決策(deterministic decision)在相同輸入下始終產生固定結果。最常見形式為 argmax,其選擇機率最大的類別作為最終預測:
此方法將整個機率分佈壓縮為單一結果,因此常用於分類任務(classification)中需要明確答案的情境。
另一常見形式為閾值決策(thresholding),即當機率超過特定閾值時輸出正類。此類方法可透過調整閾值改變 Precision 與 Recall 之間的權衡,但同樣會捨棄部分分佈資訊。
相較之下,隨機決策(stochastic decision)則根據機率分佈進行抽樣(sampling),使模型在相同輸入下可能產生不同輸出。此種方法保留不確定性資訊,因此在生成模型(generative models)、語言模型(language models)與探索問題(exploration problems)中具有重要角色。
在強化學習(reinforcement learning)中,決策機制通常被形式化為策略(policy)。貪婪策略(greedy policy)始終選擇當前最優行動;epsilon-greedy policy 則以小機率進行隨機探索;隨機策略(stochastic policy)則直接根據行動分佈進行抽樣。此類方法反映利用(exploitation)與探索(exploration)之間的平衡。
不確定性與行為生成
決策機制的核心差異在於如何處理不確定性。確定性方法將機率分佈壓縮為單一選擇,因此具有穩定與可預測的特性;隨機方法則保留分佈資訊,使模型能生成多樣化結果並維持探索能力。
從更一般的角度來看,決策機制可視為從連續表示空間(continuous representation space)到離散行動空間(discrete action space)的轉換,其設計直接影響模型的穩定性、多樣性與適應能力。
因此決策機制不僅是輸出層的技術步驟,也反映模型如何在不確定性下形成行為(behavior generation)與執行選擇(action selection)。


