HOF認知——汎用推論への精神物理学的アプローチ

Author: Asher Bond (asher.bond@distillative.ai)

要旨

現代の大規模モデルは、単一の事前学習済みTransformerバックボーン [1, 2] を、タスクごとにファインチューニングまたは検索によって適応させており、その計算資源とデータのコストは大きい。HOF認知仮説は、推論を別の仕方で組織する。小さく単一目的の「原子関数(atomic functions)」からなるライブラリを、近似最近傍探索 [3] のために高次元ベクトル空間へ索引付けし、文脈駆動の選択的活性化のもとで実行時に高階関数へと合成するのである。Attention [1] は文脈条件付きの焦点化の機構を与え、関数型プログラミングの合成 [4, 5, 6] は合成上の規律を与える。そして精神物理学——弁別閾(JND)、Weber–Fechnerのスケーリング、感度と基準を分離する信号検出理論 [7](d, β)、Stevensのべき法則——は、システムがどの中間結果に基づいて行動し、再試行し、あるいは棄却するかを統べる測定の基盤を与える。ベイズ認知 [8] は、この合成を不確実性下の推論として枠組む。このアーキテクチャは、単体の巨大モデルをスケールさせることによってではなく、再利用可能なプリミティブを再合成し、要求ごとに文脈へ関連する部分集合のみを発火させることによって、タスク横断的に汎化する。効率性の主張は条件付きかつ鋭い。選択コントローラがタスク関連のプリミティブを低いオーバーヘッドで予測するとき、まさにそのときに成立し、その条件は共有タスク上でファインチューニング済みまたは検索拡張済みのベースラインに対して測定可能である。

1. 序論

今日、汎用モデルをタスクへ適応させる道筋は、少数の使い古された経路をたどる。Transformerの事前学習 [1] とそのスケールした後継 [2] は、単一の再利用可能なバックボーンを実用的なものにした。タスク特化はその後、汎化を「破滅的忘却」[9, 10] と引き換えにするファインチューニングによって、あるいは推論時に検索された文脈へ出力を接地させる検索拡張によって達成される。これらはいずれも要求ごとの計算とメモリのコストを負い、そのどれもがハルシネーションを排除しない。

HOF認知は、異なる分解を提案する。重み更新によって特化された一つの巨大なパラメータ化関数の代わりに、多数の小さく合成可能な関数を保持し、要求ごとに文脈へ関連する部分集合のみを「選択」するのである。これを実現するのは三つの要素である。

  1. 関数的原子分解(Functional Atomic Decomposition, FAD)。 認知操作は、小さく単一目的の原子関数——パターン照合、閾値判定、確率的な重み付け——として表現され、それらが合成された高階関数の構成要素となる。これは関数型プログラミング [4, 5, 6] に長い系譜をもつ合成のスタイルである。
  2. 高次元ベクトル索引付け。 原子関数とその文脈は埋め込まれ、近似最近傍探索 [3] によって取り出される。関連するプリミティブは、ライブラリ全体を走査することなく想起され、再合成される。
  3. Attentionによる文脈駆動の選択的活性化。 Attention [1] は、どのプリミティブを合成するかを現在の文脈に条件付ける。mixture-of-expertsルーティングの背後にある直観を、一段下、すなわち関数選択の粒度で適用したものである。

この分解こそが主張である。本稿の残りは、設計と、システムが何に基づいて行動するかを決める精神物理学的な測定層と、それがもたらす汎化の機構とを述べる。

2. 関連研究

Transformerとattention。 Transformer [1] とGPT規模のモデル [2] は、事前学習してから適応させるというパラダイムと、本アーキテクチャが文脈条件付きの関数選択のために転用するattention機構とを確立した。

ファインチューニングとそのコスト。 タスクのファインチューニングはバックボーンを特化させるが、先行する能力を劣化させる。破滅的干渉はTransformer以前にコネクショニストネットワークにおいて特徴づけられており [9]、Elastic Weight Consolidation [10] のような正則化によって「緩和」されるにとどまり、解決はされない。パラメータ効率的な手法(adapter [11]、LoRA [12]、予算適応的なAdaLoRA [13])は適応のコストを削減するが、プリミティブの文脈条件付き「合成」を提供するものではない。

近似最近傍による想起。 GPU上の十億規模の類似度探索 [3] は、ベクトル索引付けの段階の基盤をなすベンチマーク済みの技術であり、その想起率とレイテンシの参照ベースラインである。

不確実性下の意思決定。 信号検出理論 [7] は中間結果の受理/棄却の判断を——感度(d)対基準(β)として——構造化し、ベイズ的な認知モデル [8] は推論を事前分布と証拠にわたる推定として枠組む。

関数的合成。 compose・map・foldという高階関数の語彙は関数型プログラミング [4, 5, 6] のものであり、本アーキテクチャがプリミティブを合成する代数である。

3. アーキテクチャ

コントローラは現在の要求文脈を埋め込み、ANN探索 [3] によって関連する原子関数を想起し、attentionに条件付けられた選択 [1] のもとでそれらを高階関数へと合成し、各中間結果をSDTの受理/再試行の判断 [7] を通じてゲートする。コントローラは自らの合成の受理と再試行の統計を監視し、どのプリミティブを選択するかを調整する。自らの検出記録を読み、それに照らして次の選択を調律するメタ認知的な制御ループである。

このアーキテクチャが名指すあらゆる機構は、実在し公刊された技術である——attention [1]、ANN想起 [3]、関数的合成 [4, 5, 6]、そしてSDTの判断 [7]。合成こそが寄与である。これらを、タスクごとに特化された単体ではなく、文脈ごとに選択されるプリミティブのライブラリへと組織することが、である。効率性の議論はただ一つの変数に依拠する——選択コントローラがタスク関連のプリミティブを低いオーバーヘッドで予測するか否か、である。その変数こそが本質的な問題であり、本アーキテクチャはそれを、索引へ畳み込まれた仮定ではなく、第一級の測定可能な構成要素とする。

4. 精神物理学的基盤

精神物理学は、アーキテクチャの判断を定量的たらしめる測定の学である。それは四つの応用的な道具を寄与し、そのそれぞれがパイプライン上の具体的な一点を統べる。

これらはパイプライン上の実在する判断に適用される測定の道具である——JNDは選択の閾値を定め、Weber–Fechnerはattentionの予算を定め、SDTは受理/再試行のゲートを定め、べき法則は重み付けを定める。ベイズ認知 [8] はそれらの上に位置し、合成の全体を事前分布と証拠にわたる推論として枠組む。精神物理学的な層こそ、アーキテクチャが数値と出会う場所である。

5. 汎用推論

このアーキテクチャは、特定の機構によってタスク横断的に汎化する。単体の巨大モデルをスケールさせるのではなく、再利用可能な原子関数を再合成し、入力ごとに文脈へ関連するものだけを発火させるのである。汎化とは合成的な被覆である——固定されたプリミティブのライブラリが、再結合を通じて広大なタスク空間へ及ぶ——それは、既存のプリミティブがパラメータを追加することなく合成して解ける新規タスクの割合によって測定される。

これこそ、本仮説が汎用の、そして究極的には超人的な推論効率へと向かう経路である。正しいプリミティブを低いオーバーヘッドで想起し合成するシステムは、タスクごとにスケールまたは再特化されなければならない単体よりも低いコストで、ドメインを横断して推論する。閾値の問い——そのようなシステムが人間並みの汎用性能へ到達し、それを凌駕するか——は経験的なものであり、共有されたタスクとデータセット上で、ファインチューニング済み・検索拡張済み・あるいはmixture-of-expertsのベースラインに対する測定によって決着する。本アーキテクチャは、まさにその比較において測定されるべく作られている。

証拠と適用範囲

HOF認知は、鋭く検証可能な核をもつアーキテクチャである。それが合成するあらゆる機構——attention [1]、ANN想起 [3]、関数的合成 [4, 5, 6]、SDTの判断 [7]、ベイズ的枠組み [8]——は実在し独立にベンチマークされており、精神物理学的な判断層(JND、Weber–Fechner、SDT、Stevensのべき法則)はパイプラインの各判断を測定可能な量へ接地させる。効率性の主張はただ一つの変数——選択コントローラがタスク関連のプリミティブを低いオーバーヘッドかつ高い精度で予測するか否か——に還元され、その変数こそが結果を決する直接対決である。共有タスク上でのHOF認知対、ファインチューニング済み・検索拡張済み・あるいはmixture-of-expertsのベースライン、精度と要求ごとのコストを比較し、利用可能な計算資源によって限界づけられる。選択コントローラこそが結果を決する変数であり、本アーキテクチャはそれを、測定される当のものとする。

参考文献

  1. Ashish Vaswani et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1706.03762.
  2. Tom B. Brown et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.14165. [GPT-3]
  3. Jeff Johnson et al. (2019). Billion-Scale Similarity Search with GPUs. IEEE Transactions on Big Data. arXiv:1702.08734. [FAISS]
  4. John Backus (1978). Can Programming Be Liberated from the von Neumann Style? A Functional Style and Its Algebra of Programs. Communications of the ACM. [1977 ACM Turing Award Lecture]
  5. John Hughes (1989). Why Functional Programming Matters. The Computer Journal.
  6. Christopher Strachey (2000). Fundamental Concepts in Programming Languages. Higher-Order and Symbolic Computation. [Reprint of 1967 lecture notes]
  7. David M. Green & John A. Swets (1966). Signal Detection Theory and Psychophysics. Wiley.
  8. Thomas L. Griffiths et al. (2008). Bayesian Models of Cognition. The Cambridge Handbook of Computational Psychology.
  9. Michael McCloskey & Neal J. Cohen (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation.
  10. James Kirkpatrick et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences (PNAS). arXiv:1612.00796. [Elastic Weight Consolidation (EWC)]
  11. Neil Houlsby et al. (2019). Parameter-Efficient Transfer Learning for NLP. Proceedings of the 36th International Conference on Machine Learning (ICML). arXiv:1902.00751.
  12. Edward J. Hu et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. International Conference on Learning Representations (ICLR). arXiv:2106.09685.
  13. Qingru Zhang et al. (2023). AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning. International Conference on Learning Representations (ICLR). arXiv:2303.10512.