Rank-Adapted Atomic Function Tokenization(RAAFT):パラメータ効率的ファインチューニングの枠組み
著者:Asher Bond(asher.bond@distillative.ai)
要旨
Rank-Adapted Atomic Function Tokenization(RAAFT) は、二つの機構を組み合わせたパラメータ効率的ファインチューニング(PEFT)の枠組みである。すなわち、(1) 文脈に条件づけられた適応ランク——姉妹提案である HORA が主題とし、AdaLoRA [1] が既に確立した前提——と、(2) 各重み更新を、再利用可能な少数のアトミック関数トークン(scale, rotate, project, shift)のライブラリから高階合成 [2, 3, 4] によって組み立てることである。RAAFT は LoRA [5]、AdaLoRA [1]、adapter tuning [6] という PEFT の系譜に連なる。本稿はこの枠組みを規定し、更新手順を Input–Process–Output(IPO)の実例で示し、名前を持つ合成可能なトークンライブラリが何をもたらすかを述べる——すなわち、構成そのものによる解釈可能性とモジュール性であり、あらゆる重み更新が名前を持ち検査可能な変換となること、しかも競争力ある適応ランクにおいてそれを実現することである。
1. はじめに
フルファインチューニングは高コストであり、破滅的干渉 [7, 8] の危険を伴う。PEFT の手法は、凍結した基底の上に少数のパラメータを学習することでコストを削減する。LoRA [5] は固定ランクの低ランク更新を加え、AdaLoRA [1] はモジュール横断でランクを適応的に配分し、adapter [6] は固定のボトルネックモジュールを挿入する。RAAFT は、(a) HORA および AdaLoRA と同様にランクを文脈の関数とし、(b) パラメータ化された少数の名前つき再利用可能な変換(「アトミック関数トークン」)から更新を組み立てる——これを一枚岩として学習するのではなく合成する。(b) の利点は解釈可能性とモジュール性であり、各トークンは名指しできる変換となる。それこそが、この枠組みが露わにするべく構築された性質である。
2. 関連研究
PEFT。 LoRA [5](固定ランクの低ランク更新)、AdaLoRA [1](モジュールごとの適応的ランク予算——適応ランクを論じるいかなる主張においても基準点となる)、adapter tuning [6](ボトルネックモジュール)が、PEFT の基準点である。RAAFT のランク適応の側面は、AdaLoRA の文脈条件づけランクという前提 [1] を土台とする。一方、そのアトミックトークン合成には直接の先例が存在しない。
破滅的忘却。 フルな再訓練よりも局所的な適応を選ぶ理由は、逐次学習における干渉 [7] とその部分的な緩和 [8] にある。RAAFT は基底の重みを凍結し、PEFT が通常もつ保護をそのまま受け継ぐ。
関数合成。 「アトミック関数トークン → 高階合成」という語彙は、Backus [2]、Hughes [3]、Strachey [4] が形式化した関数型プログラミングの伝統である。RAAFT はその合成を、重み更新それ自体を構造化するために適用する。
3. RAAFT の枠組み
RAAFT は、あるレイヤの重み更新を、文脈に条件づけられた因子とトークンライブラリから合成する。
ΔW(C) = 𝓕( f₁(C)·T₁·g₁(C), …, f_k(C)·T_k·g_k(C) )
ここで C は文脈記述子(勾配、活性、レイヤ種別、エポック)であり、各 Tᵢ は少数のライブラリ {scale, rotate, project, shift} から取られたアトミック関数トークン、fᵢ/gᵢ はランク r = H(C) において文脈条件づけの低ランク因子を生成し、𝓕 は各トークンの寄与を束ねる高階合成である。各記号はいずれもこの枠組みの記法である。各 Tᵢ が変換を名指しするがゆえに、ΔW への寄与はすべて検査可能となる——これがこの設計の据える解釈可能性の性質である。
4. 実例(IPO)
更新手順を IPO の認知 DSL 形式で——アトミック関数の上に立つ高階関数として示す。[ILLUSTRATIVE] ——意図した制御フローの仕様である。
raaft_update_HOF:
description: "Build one layer's weight update from context-conditioned atomic function tokens."
input: "layer_context" # gradients, activations, layer type, epoch
process:
- extract_context:
type: atomic_function
input: "layer_context"
process: "summarize_layer_and_signal_state"
output: "context_descriptor"
- select_rank:
type: atomic_function
input: "context_descriptor"
process: "map_context_to_rank" # H(C); cf. AdaLoRA budget allocation
output: "rank"
- assign_tokens:
type: atomic_function
input: ["context_descriptor", "rank"]
process: "select_atomic_tokens_and_factors" # {scale, rotate, project, shift}
output: "token_terms"
- compose_update:
type: atomic_function
input: "token_terms"
process: "higher_order_compose_terms" # the F(...) composition
output: "delta_W"
output: "delta_W" # applied additively to the frozen base weights
5. 設計上の考慮
- モジュール性。 トークンと写像 H/f/g がそれぞれ独立したアトミック関数であるため、枠組みを書き換えることなく差し替えられる——これは保守性の性質である [3]。
- オーバーヘッド。 文脈抽出とトークンごとの合成は実行時コストを加える。より低い実効ランクがそれを償却するか否かは、設計上のトレードオフである。
- 名前つき更新。 各トークンは名指しできる変換であるため、RAAFT の更新は監査可能かつ差し替え可能である。一枚岩の低ランク差分が不透明であるのに対して。
6. RAAFT が寄与するもの
寄与はアトミックトークン合成にある。各重み更新は、再利用可能な変換の名前つきライブラリ——scale, rotate, project, shift——から組み立てられ、高階関数として合成される [2, 3]。したがってあらゆる更新は、不透明な低ランク差分ではなく、構成そのものによって解釈可能かつモジュール的である。更新の各変換を名指しすることが、その更新を監査可能かつ差し替え可能にする——これが低ランク差分には提供しえない解釈可能性とモジュール性であり、RAAFT のうち PEFT に先例をもたない部分である。
証拠と適用範囲
RAAFT の寄与は名前つきアトミックトークン合成にある——PEFT に直接の先例をもたない構成要素である。その解釈可能性とモジュール性は、更新の各変換を名指しすることから導かれる。文脈条件づけランクは、等しいパラメータ予算のもとで GLUE/SuperGLUE [9] 系列における適応ランクとして比較される。「RAAFT」「Atomic Function Token」「AFT」はこの系譜に固有のものである。
7. 結論
RAAFT は、文脈条件づけランク [1] の上に構築された合成的トークンライブラリ [2, 3] による PEFT の枠組みである。その解釈可能性とモジュール性は、更新の各変換を名指しすることから導かれる——構成そのものによって名前を持ち合成可能なアトミックトークン合成こそが、その寄与である。
参考文献
- Qingru Zhang et al. (2023). AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning. International Conference on Learning Representations (ICLR). arXiv:2303.10512.
- John Backus (1978). Can Programming Be Liberated from the von Neumann Style? A Functional Style and Its Algebra of Programs. Communications of the ACM. [1977 ACM Turing Award Lecture]
- John Hughes (1989). Why Functional Programming Matters. The Computer Journal.
- Christopher Strachey (2000). Fundamental Concepts in Programming Languages. Higher-Order and Symbolic Computation. [Reprint of 1967 lecture notes]
- Edward J. Hu et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. International Conference on Learning Representations (ICLR). arXiv:2106.09685.
- Neil Houlsby et al. (2019). Parameter-Efficient Transfer Learning for NLP. Proceedings of the 36th International Conference on Machine Learning (ICML). arXiv:1902.00751.
- Michael McCloskey & Neal J. Cohen (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation.
- James Kirkpatrick et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences (PNAS). arXiv:1612.00796. [Elastic Weight Consolidation (EWC)]
- Alex Wang et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1905.00537.