古典的機械学習手法と汎用AIシステムにおけるその不変の重要性——体系的サーベイ
著者:Asher Bond(asher.bond@distillative.ai)
要旨
現在の実務は大規模な事前学習済みトランスフォーマー [1, 2] が席巻している。しかし、強化学習、アンサンブル、教師なし表現学習、半教師あり学習、進化的最適化、異常検知、次元削減、ベイズ的手法、グラフベース学習、転移学習に及ぶ古典的機械学習手法の広範な蓄積は、重厚なニューラルモデルが自動的には備えない性質——解釈可能性、低い計算コスト、過学習への頑健性、不確実性の原理的な取り扱い——を保持し続けている。本サーベイはこれらの手法群を体系化し、それぞれについて、汎用システムに組み込む価値がなお存する理由を明示する。この蓄積を深層学習の文献へと結ぶ糸は二本ある。一本は、逐次的に学習する一枚岩のモデルが忘却へ向かうという記録された傾向 [3, 4] であり、これがより軽量でモジュール的な手法を道具箱に留める根拠となる。もう一本は、不確実性下の推論をベイズの枠組みで説明する視座 [5] であり、本サーベイが扱う手法群のいくつかはこれを具現化している。主張はシステム設計に関わる。すなわち、これらの手法は「より効率的で、解釈可能で、頑健な」汎用システムを構築する。
1. 序論
機械学習の重心は大規模な事前学習済みモデル [1, 2] へと移った。この成功には記録されたコストが伴う。多大な計算資源、限られた解釈可能性、そして——逐次的に学習する一枚岩のモデルにおいては——破滅的忘却 [3, 4] である。古典的手法は、性能の頂点を、まさにこれらのコストを緩和する性質と引き換える。本サーベイは、留めておく価値が最も高い手法群を扱い、それぞれについて論拠を示す。
擁護に足る主張は端的である。これらの手法は「より効率的で、解釈可能で、頑健な」汎用システムの構築に資する。これは、有能なシステムが引き出す道具箱についての主張であり、本サーベイが裏づけるところのものである。
2. 関連研究
本稿はサーベイであるから、関連研究とはこれが書かれる際の背景そのものである。すなわち、比較の動機となるトランスフォーマーのスケーリングの系譜 [1, 2]、モジュール的で非一枚岩の手法を利用可能に保つ動機となる破滅的干渉の文献 [3, 4]、そして §3.10 の確率的手法群を支える、不確実性下の推論についてのベイズ認知の視座 [5] である。個別に扱う各手法は教科書的な技法であり、再導出するのではなく出典へと引用する。
3. 手法群のサーベイ(定性的な重要性)
各項は手法群と、それが汎用システムに対してなお重要であり続ける理由を示す。
3.1 強化学習。 アクター・クリティック法は価値ベースと方策ベースの学習を均衡させる。時間差分学習は逐次的に更新し、オンラインかつ不完全なエピソードでの学習を支える。階層的・分解的な制御(例:サブタスク階層を伴う DQN)はタスクを因子化することで意思決定をスケールさせる。「重要性:」継続的でその場での学習と、タスクの分解。
3.2 アンサンブル。 ブースティング(勾配ブースティング、AdaBoost)は弱学習器を結合する。バギングとランダムフォレストは分散を低減し、高次元でノイズを含む入力を扱う。「重要性:」大規模ネットワークに比して低い計算コストでの汎化と頑健性。
3.3 教師なし表現学習。 オートエンコーダは、圧縮・異常検知・事前学習のためのラベルなし符号化を学習する。PCA / ICA は分散または統計的独立性を保ちつつ次元を削減する。「重要性:」ラベルが乏しい状況での自律的な表現学習。
3.4 半教師あり学習。 自己学習と共訓練は、少量のラベル付きデータと並行してラベルなしデータを活用する。「重要性:」網羅的なアノテーションなしにラベルの乏しさを緩和する。
3.5 進化的・メタヒューリスティック最適化。 遺伝的アルゴリズム、粒子群最適化、焼きなまし法は、広大で微分不可能な空間を探索する。「重要性:」アーキテクチャ・戦略の探索と、ハードウェア制約下での最適化。
3.6 異常検知。 アイソレーションフォレストと局所外れ値因子は、分布外の入力を検出する。「重要性:」汎用システムが不可避的に遭遇する予期せぬ入力への対処。
3.7 次元削減・特徴学習。 NMF と因子分析は潜在構造を露わにする。「重要性:」解釈可能性と、次元的複雑性の低減。
3.8 ハイブリッド・メタ学習。 スタッキングとブレンディングは、異種のベースモデルを合成してメタモデルを構成する。「重要性:」マルチモーダルかつクロスドメインでの強みの結合。
3.9 グラフベース学習。 グラフニューラルネットワークとラベル伝播は、関係構造をモデル化する。「重要性:」相互に結びついた実体と関係にわたる学習。
3.10 ベイズ的手法。 ナイーブベイズ、ガウス過程、ベイジアンネットワークは、不確実性下の推論と信念更新について原理的な説明を与える [5]。「重要性:」限られたデータからの較正された意思決定と、逐次的な信念の改訂。
3.11 転移・マルチタスク学習。 ドメイン適応と知識転移は、学習した能力をタスク横断的に再利用する。「重要性:」訓練コストを抑えた文脈横断的な汎化——一枚岩の再訓練とその忘却 [3, 4] を回避する動機となる、まさに同じモジュール性である。
4. これらを軽視すべきでない理由
繰り返し現れる主題は次のとおりである。効率性と解釈可能性(大規模ネットワークより低い計算コストと、より明瞭な意思決定経路)、異種のタスクにわたるスケーラビリティと柔軟性、過学習への頑健性、そして古典的手法をニューラルの要素と組み合わせるハイブリッドモデルの基盤である。これらは、当該手法群を汎用システムの第一級の構成要素として範囲内に留めることを支持する工学的論拠である。
証拠と範囲
本稿は体系的なサーベイである。古典的な手法群を整理し、破滅的干渉の文献 [3, 4] と不確実性下の推論についてのベイズ的説明 [5] に立脚して、それぞれについてシステム設計上の論拠を示す。主張は定性的であり、システム設計に関わる——各手法群が道具箱の中でどこにその位置を得るか——ものであって、直接対決のベンチマーク結果ではない。範囲は意図的に定めてある。これらの手法は汎用システムに効率性・解釈可能性・頑健性をもたらし、それらを留めておくことで道具箱はいっそう強くなる。
References
- Ashish Vaswani et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1706.03762.
- Tom B. Brown et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.14165. [GPT-3]
- Michael McCloskey & Neal J. Cohen (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation.
- James Kirkpatrick et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences (PNAS). arXiv:1612.00796. [Elastic Weight Consolidation (EWC)]
- Thomas L. Griffiths et al. (2008). Bayesian Models of Cognition. The Cambridge Handbook of Computational Psychology.