Rank-Adapted Atomic Function Tokenization(RAAFT):パラメータ効率的ファインチューニングの枠組み

著者:Asher Bond(asher.bond@distillative.ai

要旨

Rank-Adapted Atomic Function Tokenization(RAAFT) は、二つの機構を組み合わせたパラメータ効率的ファインチューニング(PEFT)の枠組みである。すなわち、(1) 文脈に条件づけられた適応ランク——姉妹提案である HORA が主題とし、AdaLoRA [1] が既に確立した前提——と、(2) 各重み更新を、再利用可能な少数のアトミック関数トークン(scale, rotate, project, shift)のライブラリから高階合成 [2, 3, 4] によって組み立てることである。RAAFT は LoRA [5]、AdaLoRA [1]、adapter tuning [6] という PEFT の系譜に連なる。本稿はこの枠組みを規定し、更新手順を Input–Process–Output(IPO)の実例で示し、名前を持つ合成可能なトークンライブラリが何をもたらすかを述べる——すなわち、構成そのものによる解釈可能性とモジュール性であり、あらゆる重み更新が名前を持ち検査可能な変換となること、しかも競争力ある適応ランクにおいてそれを実現することである。

1. はじめに

フルファインチューニングは高コストであり、破滅的干渉 [7, 8] の危険を伴う。PEFT の手法は、凍結した基底の上に少数のパラメータを学習することでコストを削減する。LoRA [5] は固定ランクの低ランク更新を加え、AdaLoRA [1] はモジュール横断でランクを適応的に配分し、adapter [6] は固定のボトルネックモジュールを挿入する。RAAFT は、(a) HORA および AdaLoRA と同様にランクを文脈の関数とし、(b) パラメータ化された少数の名前つき再利用可能な変換(「アトミック関数トークン」)から更新を組み立てる——これを一枚岩として学習するのではなく合成する。(b) の利点は解釈可能性とモジュール性であり、各トークンは名指しできる変換となる。それこそが、この枠組みが露わにするべく構築された性質である。

2. 関連研究

PEFT。 LoRA [5](固定ランクの低ランク更新)、AdaLoRA [1](モジュールごとの適応的ランク予算——適応ランクを論じるいかなる主張においても基準点となる)、adapter tuning [6](ボトルネックモジュール)が、PEFT の基準点である。RAAFT のランク適応の側面は、AdaLoRA の文脈条件づけランクという前提 [1] を土台とする。一方、そのアトミックトークン合成には直接の先例が存在しない。

破滅的忘却。 フルな再訓練よりも局所的な適応を選ぶ理由は、逐次学習における干渉 [7] とその部分的な緩和 [8] にある。RAAFT は基底の重みを凍結し、PEFT が通常もつ保護をそのまま受け継ぐ。

関数合成。 「アトミック関数トークン 高階合成」という語彙は、Backus [2]、Hughes [3]、Strachey [4] が形式化した関数型プログラミングの伝統である。RAAFT はその合成を、重み更新それ自体を構造化するために適用する。

3. RAAFT の枠組み

RAAFT は、あるレイヤの重み更新を、文脈に条件づけられた因子とトークンライブラリから合成する。

ΔW(C) = 𝓕( f(C)·T·g(C), , f_k(C)·T_k·g_k(C) )

ここで C は文脈記述子(勾配、活性、レイヤ種別、エポック)であり、各 T は少数のライブラリ {scale, rotate, project, shift} から取られたアトミック関数トークン、f/g はランク r = H(C) において文脈条件づけの低ランク因子を生成し、𝓕 は各トークンの寄与を束ねる高階合成である。各記号はいずれもこの枠組みの記法である。各 T が変換を名指しするがゆえに、ΔW への寄与はすべて検査可能となる——これがこの設計の据える解釈可能性の性質である。

4. 実例(IPO)

更新手順を IPO の認知 DSL 形式で——アトミック関数の上に立つ高階関数として示す。[ILLUSTRATIVE] ——意図した制御フローの仕様である。

raaft_update_HOF:
 description: "Build one layer's weight update from context-conditioned atomic function tokens."
 input: "layer_context" # gradients, activations, layer type, epoch
 process:
 - extract_context:
 type: atomic_function
 input: "layer_context"
 process: "summarize_layer_and_signal_state"
 output: "context_descriptor"
 - select_rank:
 type: atomic_function
 input: "context_descriptor"
 process: "map_context_to_rank" # H(C); cf. AdaLoRA budget allocation
 output: "rank"
 - assign_tokens:
 type: atomic_function
 input: ["context_descriptor", "rank"]
 process: "select_atomic_tokens_and_factors" # {scale, rotate, project, shift}
 output: "token_terms"
 - compose_update:
 type: atomic_function
 input: "token_terms"
 process: "higher_order_compose_terms" # the F(...) composition
 output: "delta_W"
 output: "delta_W" # applied additively to the frozen base weights

5. 設計上の考慮

6. RAAFT が寄与するもの

寄与はアトミックトークン合成にある。各重み更新は、再利用可能な変換の名前つきライブラリ——scale, rotate, project, shift——から組み立てられ、高階関数として合成される [2, 3]。したがってあらゆる更新は、不透明な低ランク差分ではなく、構成そのものによって解釈可能かつモジュール的である。更新の各変換を名指しすることが、その更新を監査可能かつ差し替え可能にする——これが低ランク差分には提供しえない解釈可能性とモジュール性であり、RAAFT のうち PEFT に先例をもたない部分である。

証拠と適用範囲

RAAFT の寄与は名前つきアトミックトークン合成にある——PEFT に直接の先例をもたない構成要素である。その解釈可能性とモジュール性は、更新の各変換を名指しすることから導かれる。文脈条件づけランクは、等しいパラメータ予算のもとで GLUE/SuperGLUE [9] 系列における適応ランクとして比較される。「RAAFT」「Atomic Function Token」「AFT」はこの系譜に固有のものである。

7. 結論

RAAFT は、文脈条件づけランク [1] の上に構築された合成的トークンライブラリ [2, 3] による PEFT の枠組みである。その解釈可能性とモジュール性は、更新の各変換を名指しすることから導かれる——構成そのものによって名前を持ち合成可能なアトミックトークン合成こそが、その寄与である。

参考文献

  1. Qingru Zhang et al. (2023). AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning. International Conference on Learning Representations (ICLR). arXiv:2303.10512.
  2. John Backus (1978). Can Programming Be Liberated from the von Neumann Style? A Functional Style and Its Algebra of Programs. Communications of the ACM. [1977 ACM Turing Award Lecture]
  3. John Hughes (1989). Why Functional Programming Matters. The Computer Journal.
  4. Christopher Strachey (2000). Fundamental Concepts in Programming Languages. Higher-Order and Symbolic Computation. [Reprint of 1967 lecture notes]
  5. Edward J. Hu et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. International Conference on Learning Representations (ICLR). arXiv:2106.09685.
  6. Neil Houlsby et al. (2019). Parameter-Efficient Transfer Learning for NLP. Proceedings of the 36th International Conference on Machine Learning (ICML). arXiv:1902.00751.
  7. Michael McCloskey & Neal J. Cohen (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation.
  8. James Kirkpatrick et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences (PNAS). arXiv:1612.00796. [Elastic Weight Consolidation (EWC)]
  9. Alex Wang et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1905.00537.