HOF認知こそすべてである——オーケストレーション層における合成

著者: Asher Bond (asher.bond@distillative.ai)

要旨

Transformerの「Attention Is All You Need」[1] は、能力の所在を単一の機構に定めた。本稿はそれを一段上——高階関数(HOF)合成——に定める。すなわち、認知的操作を第一級関数として扱い、文脈によって選択し、実行時に組み合わせる。本稿の主張は、いずれか一つの機構ではなく合成を中心にAIシステムを組織することこそが、実運用を支配する三つの問題——異種の下位振る舞いの統合、乏しい教師信号のもとでの適応、そしてどの文脈を有効にするかの管理——に取り組む生産的な道だ、というものである。合成は関数型プログラミングにおいて確立された構造である [2, 3, 4]。本稿の貢献は、それがモデルの上、すなわちオーケストレーション層に属するという立場、そして本分野の代替手法であるファインチューニング [5] と検索拡張生成(RAG)[6] は、合成が競合する相手ではなく合成が配置する対象である、という主張にある。

1. はじめに

Transformerは再帰と畳み込みをattentionで置き換え、「…Is All You Need」という題は一つのジャンルとなった [1]。本稿はそのジャンルを額面どおりに受け取り、主張を一段上へ引き上げる。提案はこうだ——言語モデルの実運用における未解決問題の多く、すなわち異種の下位振る舞いの統合、乏しい教師信号のもとでの適応、どの文脈を有効にするかの管理は、実のところ一つの問題である。適切な関数を適切な時に合成すること、これに尽きる。

高階関数は関数を引数に取るか、関数を返す [4]。それらを合成してシステムを構築することは、モジュール性を支持する関数型プログラミングの論拠そのものだ [2, 3]。HOF認知はその構造をモデル振る舞いの実行時オーケストレーションへと引き上げ、有能なシステムを組織する原理が宿るのは——その内部のいずれか単一の機構ではなく——オーケストレーション層である、と主張する。

2. 関連研究

Attentionとそのジャンル。 Transformerとその題は直接の参照点である [1]。HOF認知は同じ枠組みを採り、十分性の主張を、機構から、機構を配置する合成層へと移す。

関数合成。 高階関数と関数水準プログラミングは確立されている [2, 3, 4]。HOF認知はその基盤の上に直接立ち、関数水準の合成をモデル振る舞いの実行時オーケストレーションへと引き上げる。

適応と接地。 本立場が取り組む問題は、本分野で現に稼働している基準線である——教師あり適応とその忘却コスト [5, 7, 8]、パラメータ効率的な適応 [9, 10]、そして残存する幻覚を伴う検索接地 [6, 11]。合成はこれらを配置する層であって、そのいずれかを置き換えるものではない。

3. 立場

主張。 認知を、第一級関数の文脈選択的合成として枠づけることこそが、繰り返し現れる三つの問題に対する正しい工学的スタンスである。

その射程は一般的だ——自己注意をスケールさせるのではなく高階関数を合成することによって、統合・教師なし学習・文脈管理の各課題を横断して一般化する。知能を一関数ずつ一般化するのである。

この系譜に連なる内部システム——ESPとECO——は、本著者の工学的成果物であり、このスタンスを具現する。それらは合成が生み出すアーキテクチャを例証している。

根拠と射程

HOF認知は、論拠を備えた一つの立場である。その基盤は関数型プログラミングの伝統 [2, 3, 4] にあり、それを実行時オーケストレーションへ引き上げたものである。その基準線は本分野で現に稼働する代替手法——ファインチューニング [5]、パラメータ効率的な適応 [9, 10]、検索拡張生成(RAG)[6]——であり、合成はこれらを捨てるのではなく配置する。ここに名を挙げた内部システムESPとECOは、このスタンスを具現し、アーキテクチャを例証する。主張は精確だ——いかなる単一の機構よりも上、オーケストレーション層における合成こそが、振る舞いを統合し、教師なしで適応し、自らの文脈を管理するシステムの組織原理である。

References

  1. Ashish Vaswani et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1706.03762.
  2. John Backus (1978). Can Programming Be Liberated from the von Neumann Style? A Functional Style and Its Algebra of Programs. Communications of the ACM. [1977 ACM Turing Award Lecture]
  3. John Hughes (1989). Why Functional Programming Matters. The Computer Journal.
  4. Christopher Strachey (2000). Fundamental Concepts in Programming Languages. Higher-Order and Symbolic Computation. [Reprint of 1967 lecture notes]
  5. Jeremy Howard & Sebastian Ruder (2018). Universal Language Model Fine-tuning for Text Classification. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (ACL). arXiv:1801.06146. [ULMFiT]
  6. Patrick Lewis et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.11401. [RAG]
  7. Michael McCloskey & Neal J. Cohen (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation.
  8. James Kirkpatrick et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences (PNAS). arXiv:1612.00796. [Elastic Weight Consolidation (EWC)]
  9. Edward J. Hu et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. International Conference on Learning Representations (ICLR). arXiv:2106.09685.
  10. Qingru Zhang et al. (2023). AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning. International Conference on Learning Representations (ICLR). arXiv:2303.10512.
  11. Ziwei Ji et al. (2023). Survey of Hallucination in Natural Language Generation. ACM Computing Surveys. arXiv:2202.03629.