推論の汎化に向けた文脈条件付きランク適応 — 固定・全体・適応的ファインチューニングの定性的比較

著者: Asher Bond (asher.bond@distillative.ai)

要旨

時間経過に伴う推論の汎化 — タスクと分布がドリフトしてもモデルを有用に保つこと — は、モデルがどう適応するかで決まる。パラメータ効率的ファインチューニング(PEFT)の三つの戦略が、この設計空間を張る。全体ファインチューニングは全重みを更新する。LoRA [1] は固定した低ランクで適応する。AdaLoRA [2] を筆頭とする適応的ランク手法は層ごとにランクを変える。本稿はこれらを、ドリフトを支配する軸 — 推論容量、適応性、適応の粒度、忘却への曝露、コスト — に沿って比較し、文脈条件付きかつトークン合成型の変種である RAAFT/HORA を、そのスペクトルの適応的な端に位置づける。測定したところは、測定値をそのまま報告する。RoBERTa-base RTE [3]、各条件で三シード、DoRA 0.743 > LoRA 0.727 > 全体ファインチューニング 0.718 > AdaLoRA 0.651 [MEASURED]。この比較が切り出す問いは鋭く、ただ一つである。すなわち、文脈コントローラが十分に低いオーバーヘッドでタスクごとにランクを配分でき、適応的な適応が同一パラメータ予算のもとで最強の調整済みベースラインに並ぶか、それを上回れるか、である。AdaLoRA [2] は、この問いを測定する相手となる最先端の適応的ベースラインである。

1. はじめに

モデルの長期的な有用性は、タスクとデータ分布がドリフトするなかで汎化できるかにかかっている。LoRA [1] は固定ランクで適応する。全体ファインチューニングは全重みを更新し、破滅的干渉 [4, 5] に最も曝される。AdaLoRA [2] はランクを適応的に変える。RAAFT/HORA(併載の RAAFT 論文を参照)は、この適応的な方向を拡張する。ランクを実行時の文脈に条件づけ、更新を原子的トークンから合成する。中心の問いは、世界が動くなかでどの適応戦略が持ちこたえるか、である。本稿は、ドリフト挙動を決める軸に沿って戦略を構造的に比較し、それらを分かつ唯一の経験的な問いを名指しし、我々が測定した RTE 条件を報告する。

2. 関連研究

PEFT ベースライン。 LoRA [1](固定ランク)、AdaLoRA [2](適応的ランク。あらゆる適応的手法にとって最先端の比較点)、そしてアダプタ [6]。文脈条件付き適応が最先端を上回るという主張は、AdaLoRA に対する主張であって、LoRA と全体ファインチューニングだけに対するものではない。

忘却と継続的適応。 逐次学習における干渉 [4] とその部分的な緩和 [5] は、「時間経過に対する安定性」という軸の背後にある現象である。凍結したベースは曝露を抑える。ここで比較するどの手法も、それ以上の専用の忘却対策を主張しない。

推論と評価。 SuperGLUE [3] は、この比較が依拠するベンチマーク群である。自己整合性デコーディング [7] は、推論の信頼性を高めるために別途公表された技法であり、PEFT 手法の選択とは直交し、「推論の汎化」を確立された文献のなかに位置づける。

3. 定性的比較

以下の軸は、タスクがドリフトするときに適応戦略がどう振る舞うかを支配する。各項目は方向性の期待であり、§5 の RTE 条件が測定値を担う唯一の軸である。

全体ファインチューニング LoRA(固定ランク)[1] 適応的/文脈条件付きランク [cf. @zhang2023adalora]
推論容量 高い(全重みが自由) 中程度(固定した低ランク予算) より低い予算で同等 — 予測 [ILLUSTRATIVE]
ドリフトへの適応性 乏しい(再学習を要する) 限定的(固定ランク) 再配分されたランクで良好 — 予測 [ILLUSTRATIVE]
適応の粒度 粗い 粗い〜中程度 より細かく、文脈ごと — 予測 [ILLUSTRATIVE]
忘却への曝露 最も高い [4] より低い(凍結したベース) より低い(凍結したベース)
コストの特性 最も高い 低い 低い、加えてコントローラのオーバーヘッド

This table lays out 軸, 全体ファインチューニング, LoRA(固定ランク)[1], 適応的/文脈条件付きランク [cf. @zhang2023adalora] across 5 rows.

右端の列の優位性は、ただ一点に条件づけられている。すなわち、ランクを正しくかつ安価に配分する文脈コントローラである。この条件こそが比較の実質である。固定ランクのベースラインは二次ではない。次元 n の層に対するランク r の LoRA 更新は O(r·n)rn のコストである [1]。文脈条件付き手法が主張するいかなる計算量も、その O(r·n) の下限に対して導出され測定されるべき設計目標であって、言い張るものではない。

4. 例示的なコスト計算

適応的ランクの効率性に対する論拠は、明示された仮定のもとでの算術である。[ILLUSTRATIVE] あるタスクが、固定した最悪ケースのランク r_fixed の割合 φ にあたる平均実効ランク r̄ を許容すると仮定する。すると適応パラメータ数は r_fixed ではなく φ·r_fixed に比例し、(1 − φ) の節約となる。φ = 0.5 では、パラメータの 50% 削減である。経験的な中身はすべて、コントローラが精度を犠牲にせずに r̄ φ·r_fixed を選べるかにある — これは AdaLoRA が直接測定するのと同じ量である [2]。

推論時の類似物は、具体的なベースラインを名指しする。[ILLUSTRATIVE] ベースライン B を、各 O(n) の作業を要する k 個の候補継続を評価する一枚岩の逐次推論器とし、総計 O(k·n) とする。mk 個の候補のみを評価する選択的・文脈ゲート型の手法は O(m·n) に比例し、仮定した選択率 m/k のもとで (1 m/k) の節約となる。経験的な中身は、コントローラが正しい m 個の候補を選べるかにある。

5. 測定結果

RoBERTa-base RTE [3]、各条件で三シード、平均(範囲): [MEASURED] DoRA 0.743 (0.729–0.755)、LoRA 0.727 (0.704–0.751)、全体ファインチューニング 0.718 (0.704–0.733)、AdaLoRA 0.651 (0.635–0.682)。この条件では、分解に基づく DoRA が先頭に立ち、固定ランクの LoRA と全体ファインチューニングが続き、適応的ランクのベースライン(AdaLoRA)が最下位に位置する。一つのベンチマーク条件が五軸の比較を決着させることはなく、しかもこの条件は適応的仮説を美化しない — だからこそこれが荷重を担う数値なのである。文脈条件付き手法が越えるべき水準は、同一パラメータ予算のもとで最強の調整済みベースラインであり、RTE ではそれは 0.743 の DoRA である。

根拠と範囲

これは、測定された条件を一つ伴う構造的な比較である。定性的な軸は方向性の期待であり、コスト計算は明示した仮定のもとでの例示であり、RTE の結果は RoBERTa-base 上で各条件三シードにわたり測定されている。RAAFT/HORA は適応的ランクのスペクトル上の一設計として加わり、その優位性は、低オーバーヘッドでランクを正しく配分する文脈コントローラに条件づけられている — これは AdaLoRA を含むあらゆる適応的手法が経験的に稼ぐ、まさにその一つの量である。比較点は AdaLoRA [2] であり、同一パラメータ予算のもとで最強の調整済みベースラインが、いかなる文脈条件付き手法も自らの地位を得るために越える水準である。

参考文献

  1. Edward J. Hu et al. (2022). LoRA: Low-Rank Adaptation of Large Language Models. International Conference on Learning Representations (ICLR). arXiv:2106.09685.
  2. Qingru Zhang et al. (2023). AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning. International Conference on Learning Representations (ICLR). arXiv:2303.10512.
  3. Alex Wang et al. (2019). SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1905.00537.
  4. Michael McCloskey & Neal J. Cohen (1989). Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem. Psychology of Learning and Motivation.
  5. James Kirkpatrick et al. (2017). Overcoming Catastrophic Forgetting in Neural Networks. Proceedings of the National Academy of Sciences (PNAS). arXiv:1612.00796. [Elastic Weight Consolidation (EWC)]
  6. Neil Houlsby et al. (2019). Parameter-Efficient Transfer Learning for NLP. Proceedings of the 36th International Conference on Machine Learning (ICML). arXiv:1902.00751.
  7. Xuezhi Wang et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. International Conference on Learning Representations (ICLR). arXiv:2203.11171.