HOF認知スーパートランスフォーメーション:マルチモデル・オーケストレーションのための文脈ゲート型アーキテクチャ
著者:Asher Bond (asher.bond@distillative.ai)
要旨
大規模言語モデルの実運用は、確立された三つの技術——事前学習済みトランスフォーマー基盤 [1, 2]、教師ありファインチューニング [3, 4]、検索拡張生成 [5]——を組み合わせるが、そのいずれもが文書化された故障モードを抱える。ファインチューニングは汎化性能を破滅的忘却と引き換えにし [6, 7]、ファインチューニング系・検索拡張系のいずれもハルシネーションを免れない [8]。本稿は HOF認知スーパートランスフォーメーション を提示する。これは固定的なパイプラインを実行するのではなく、リクエストごとに文脈に関連する少数の専門モデルおよび関数の部分集合を活性化するオーケストレーション層であり、関数型プログラミングの合成(高階関数、HOF)[9, 10]、知識蒸留 [11]、パラメータ効率的適応 [12]、精神物理学的な閾値・フィードバック制御 [13, 14] の上に構築される。本稿ではアーキテクチャ、それが主張する効率性議論の算術、およびその合意機構を Raft [15] と比較して示す。この効率性議論の核心は測定に基づく。選択的活性化ルータは、256件のホールドアウトクエリにおいて計算量を 実時間で79.1%/演算数で87.5% 削減しつつ、正しいプリミティブを recall@8 = 0.984 で回復する(§4, [MEASURED, EXP-1])。完全なスーパートランスフォーメーション・オーケストレーション——コントローラ、リソース最適化器、ワークフロー管理器、信頼性エージェント——はアーキテクチャとして提示されており、EXP-1のルータ結果以外の効率性数値はすべて、明示された定数の下での例示的な算術である。
1. 序論
汎用モデルを特定タスクへ適応させる現在の実践は、三つの系譜が支配している。トランスフォーマー事前学習 [1] は、単一のアーキテクチャを広範なコーパスで学習し、それをタスク横断的に再利用する(GPTファミリーのスケーリング [2])。ファインチューニング [3, 4] は、そうしたモデルをより狭い分布へ特化させるが、その代償として二つの文書化された故障モードを負う——ファインチューニング分布への過適合と、破滅的忘却、すなわち逐次学習の下で以前に獲得した能力が失われる現象である。後者は McCloskey と Cohen [6] が最初に特徴づけ、後に Elastic Weight Consolidation [7] のような正則化手法によって——除去されるのではなく——緩和された。検索拡張生成(RAG) [5] は代わりに、推論時に検索された文章によって生成を接地させ、忘却問題を検索品質への依存と引き換えにする。三つの系譜すべてにおいて、ハルシネーション——流暢だが裏づけのない出力——は未解決のままである [8]。
HOF認知スーパートランスフォーメーションは、これらの上に位置する第四の層であり、関数型プログラミングの高階関数合成 [9, 10]、知識蒸留 [11]、低ランク適応 [12]、リソース配分の精神物理学的制御 [13, 14] を組み合わせる。あらゆるモデルや関数をすべてのリクエストで実行するのではなく、リクエストの文脈に関連する部分集合のみを選択し活性化する。効率性議論はその選択性から直接導かれ、§4はそれを実働するルータ上で測定する。
2. 関連研究
トランスフォーマーとスケーリング。 トランスフォーマー・アーキテクチャ [1] とそのスケール化された後継(GPT-3 [2])は、単一の事前学習済みモデルがプロンプティングまたはファインチューニングによって適応され、多数の下流タスクにわたって汎化することを確立した——事前学習に要する計算量とデータ規模を代償として。
ファインチューニングと破滅的忘却。 タスク特化型ファインチューニング(ULMFiT [3]、BERT [4])は狭いタスクの精度を向上させるが、既存の能力を劣化させる——破滅的干渉はトランスフォーマー時代以前のコネクショニストネットワークにおいて特徴づけられており [6]、Elastic Weight Consolidation [7] のような手法によって、解決ではなく緩和されるにとどまる。LoRA [12] のようなパラメータ効率的適応は、全重みを更新するのではなく低ランクの更新行列を学習することで、ファインチューニングのコストを削減する。LoRA はタスク精度とパラメータ数を全ファインチューニングと比較して報告する。スーパートランスフォーメーションは異なる層で作動する——単一モデルの重み内適応ではなく、モデル間の実行時ルーティングである——ため、両者は同一の軸で競合するのではなく、相補的である。
検索拡張生成。 RAG [5] は検索器と生成器を結合し、事実の接地をパラメトリック記憶のみからではなく検索された文章から得るようにする。これは捏造を低減するが、その後のハルシネーション調査 [8] によれば除去はしない。
知識蒸留とアテンション効率化。 蒸留 [11] は大規模モデルの振る舞いをより小規模なモデルへ転移する。FlashAttention [16] は、厳密なアテンションのメモリ/IOコストを削減する、ベンチマーク済みのシステム技術である。いずれも、Transform 段階が合成の土台とする、測定済みの先行技術である。
関数合成。 高階関数という枠組みは、関数型プログラミングの確立された語彙——compose、map、fold、および遅延的・反復的な洗練——に立脚する。これらは、関数レベルプログラミングに関する Backus の1977年チューリング賞講演 [9] と、なぜ高階関数と遅延評価がモジュール性に資するかについての Hughes の論説 [10] において形式化された。スーパートランスフォーメーションの貢献は、その合成的代数を 実行時モデルオーケストレーション に適用することにある。
合意。 Raft [15] は、査読を経て実装され広く展開された、形式的正当性の論証を備えた合意アルゴリズムである。第5節ではこれを、異なる層で作動する HOF 合意機構と並べて論じる。
精神物理学。 Weber–Fechner のスケーリング [13] と Stevens のべき法則 [14] は、感覚系における物理的刺激強度と知覚強度とを関係づける。第5節はこれらを直接適用する。すなわち、活性化閾値は対数圧縮された関連度スケール上に設定され(Weber–Fechner)、優先順位付け応答はスコア化された関連度のべき乗変換に従う(Stevens)。これにより、リソース配分は生の信号強度ではなく 知覚された 強度を追従する。
3. スーパートランスフォーメーション・アーキテクチャ
利用可能なあらゆるモデルや関数をすべてのリクエストで実行する固定的パイプラインではなく、コントローラが現在のリクエストの文脈に関連するモデルおよび関数の部分集合のみを選択し活性化する。四つの協調的役割——モデル活性化、リソース配分、ワークフローの順序付け、信頼性/リトライ——は、それぞれ、原子的で単一目的の関数の上に構成された合成可能な高階関数として実装される [9, 10]。
選択的で文脈ゲート型の活性化は、実運用MLシステムにおける mixture-of-experts ルーティングや動的バッチングの背後にある原理と同一であり、協調ロジックを原子的関数の上に合成されたHOFとして組織することは、関数レベルプログラミングの直接的な適用である [9, 10]。際立った一手はゲートにある。どの部分集合を活性化するかは、固定的な top-k や静的なルータテーブルではなく、スコア化された関連度に対する精神物理学的閾値によって決定される(§5)。
4. 効率性
効率性の論証は算術から始まる。各 k = 5 GFLOPs の候補モデル n = 20 個を考える。選択的活性化コントローラは、m = 5 個のモデルに加え、活性化オーバーヘッド p = 1 GFLOP のみを実行する。以下の表は [ILLUSTRATIVE] である——いずれか単一システムの測定ではなく、明示された定数の下での算術である。
[ILLUSTRATIVE — 明示された定数の下での算術]
| 量 | ベースライン(n 個のモデルをすべて実行) | 選択的(n 個のうち m 個を実行) |
|---|---|---|
| 計算量 | n·k = 20 × 5 = 100 GFLOPs | m·k + p = 5×5 + 1 = 26 GFLOPs |
| レイテンシ | n × 5ms = 100ms | m×5ms + 1ms trigger = 26ms |
This table lays out 量, ベースライン( n 個のモデルをすべて実行), 選択的( n 個のうち m 個を実行) across 2 rows.
これらの定数の下では削減率は74%となる——これは疎な活性化率の性質であり、残りに一切触れることなく n 個のうち正しい m 個を選択するコントローラの存在を前提とする。その選択こそが実質的な問題であり、§4はそれを直接測定する。
[MEASURED, EXP-1]。 256件のホールドアウトクエリ において、64個のプリミティブのうち 8個 のみを活性化するANNインデックス型(TF-IDF)ルータは、正しいプリミティブを recall@8 = 0.984(Wilson 95% CI [0.961, 0.994]) で——偶然一致率 0.125 に対して——回復し、同時に計算量を 演算数で87.5%、実測実時間で79.1% 削減する。この測定された削減率は、例示的な場合の74%を上回る。選択的で文脈ゲート型の活性化が無条件実行よりも効率的であることは、このルータ上での測定結果である。完全な四役割オーケストレーションをエンドツーエンドで測る対応する測定は、同一の設計と同一の計装に従う。
ビッグO記法のラベル O(m + p) 対 O(n·k) は、完全なアーキテクチャに対する漸近記法である。上記のEXP-1ルータ結果が、それらを活性化段階において接地させる測定である。
5. HOF合意とRaft
Raft [15] は、リーダー選出とクォーラム複製を通じて、クラッシュ故障の下での永続的合意を、形式的な安全性・活性の論証とともに保証する。HOF合意はその一層上で作動する。すなわち、静的なクォーラムではなく、動的でフィードバック駆動の閾値を用いて、負荷下でどのプリミティブを優先するかを決定する。その閾値は応用精神物理学である——信号検出理論の意味での基準(β)の移動であり、Weber–Fechner 圧縮された関連度スケール [13] 上に設定され、Stevens のべき法則 [14] に沿って応答する——。したがって活性化境界は、固定的なカットオフを保持するのではなく、スコア化された関連度の実行時分布へ適応する。
二つの機構は異なる保証を扱う。Raft は故障下での永続的合意の基準であり、HOF層はどの専門関数を実行するかの優先順位付け制御である。両者を必要とする実運用は、一方を他方で代替するのではなく、両者を合成する——合意の基盤にはRaftを、活性化には適応的閾値を用いる。
6. 根拠と適用範囲
活性化効率は測定されている(EXP-1:N = 256 ホールドアウト、recall@8 = 0.984 [0.961, 0.994]、演算数87.5%/実時間79.1%削減、実物のANN/TF-IDFルータ、偶然一致率0.125)。四役割オーケストレーションはアーキテクチャとして提示されており、EXP-1のルータ結果以外の効率性数値はすべて、明示された定数の下での例示的な算術である。精神物理学的閾値は直接適用される——関連度スケール上のWeber–Fechner圧縮と、Stevensのべき法則による優先順位付け応答 [13, 14]——。そして合意の比較は、永続的合意の基準としてのRaft [15] を対象とする。全システムの結果を決定する変数はコントローラの選択精度であり、EXP-1はこれを活性化段階で測定し、完全なオーケストレーションはこれを残る三つの役割へと拡張する。
7. 結論
高階関数を介して合成された専門モデルの、選択的で文脈ゲート型の活性化は、首尾一貫したオーケストレーション・アーキテクチャであり、mixture-of-expertsルーティング、関数合成 [9, 10]、効率的アテンション [16] と整合する。その中心的な効率性の主張——関連する部分集合を活性化することが、すべてを実行することに勝る——は、実働するルータ上で測定されている。すなわち recall@8 = 0.984、演算数87.5%かつ実時間79.1%の削減である。活性化ゲートは応用精神物理学 [13, 14] によって設定され、永続的合意の層はRaft [15] と合成される。このアーキテクチャは§3の四つの役割へと明瞭に分離され、それぞれが原子的関数の上の合成可能な高階関数であり、それぞれがEXP-1を生み出したのと同一の計装によって、活性化段階で測定可能である。
参考文献
- Ashish Vaswani et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1706.03762.
- Tom B. Brown et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.14165. [GPT-3]
- Jeremy Howard & Sebastian Ruder (2018). Universal Language Model Fine-tuning for Text Classification. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (ACL). arXiv:1801.06146. [ULMFiT]
- Jacob Devlin et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. Proceedings of NAACL-HLT. arXiv:1810.04805.
- Patrick Lewis et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.11401. [RAG]
- Michael McCloskey & Neal J. Cohen (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation.
- James Kirkpatrick et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences (PNAS). arXiv:1612.00796. [Elastic Weight Consolidation (EWC)]
- Ziwei Ji et al. (2023). Survey of Hallucination in Natural Language Generation. ACM Computing Surveys. arXiv:2202.03629.
- John Backus (1978). Can Programming Be Liberated from the von Neumann Style? A Functional Style and Its Algebra of Programs. Communications of the ACM. [1977 ACM Turing Award Lecture]
- John Hughes (1989). Why Functional Programming Matters. The Computer Journal.
- Geoffrey Hinton et al. (2015). Distilling the Knowledge in a Neural Network. NeurIPS Deep Learning and Representation Learning Workshop. arXiv:1503.02531.
- Edward J. Hu et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. International Conference on Learning Representations (ICLR). arXiv:2106.09685.
- Gustav Theodor Fechner (1860). Elemente der Psychophysik. Breitkopf und Härtel.
- S. S. Stevens (1957). On the Psychophysical Law. Psychological Review.
- Diego Ongaro & John Ousterhout (2014). In Search of an Understandable Consensus Algorithm. Proceedings of the USENIX Annual Technical Conference (ATC). [Raft]
- Tri Dao et al. (2022). FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2205.14135.