HOF認知的精神物理学的検証:LLM出力ゲーティングのための信号検出的枠組み

著者:Asher Bond (asher.bond@distillative.ai)

要旨

LLMの出力妥当性は未解決の問題である。モデルは真実ではなく尤度を最適化するため、ハルシネーションを起こす [1]。本稿は、LLM出力の検証器を信号検出理論(SDT)[2] における「検出器」として定式化する。受理/棄却の判断は感度項(d)と可変の判断基準(β)によって特徴づけられ、候補が基準の棄却側に落ちたとき適応的リトライループが発火する。SDTはここで用いる応用精神物理学的手法の一つである。Weber–Fechnerのスケーリング [3] とStevensのべき法則 [4] が、判断閾値が適応する対数量的基盤を与える。そして検証・リトライアーキテクチャの全体は、関数合成の代数の上で認知DSL/IPO(Input–Process–Output)記法によって表現される [5, 6, 7]。測定結果は二つに分かれる [PARTIALLY-SUPPORTED]。自己一貫性検証器は真正の検出器であり(d = 0.72、95% CI [0.10, 1.35]、下限 > 0)、一方で適応的リトライによる信頼性の向上は小さく、統計的に有意でない(Δ = +1.3%、McNemar p = 0.63)。いずれの事実もそのまま報告する。実信号を分解する検出器と、針をほとんど動かさないリトライループ、その二つがデータの示すものである。

1. はじめに

LLM [8, 9] は流暢なテキストを生成するが、それが外的事実や内的論理制約に忠実である保証はない。この失敗、すなわちハルシネーションは文書化されており、なお未解決である [1]。だからこそ出力の検証が必要とされる。二つの圧力がこれを複合化させる。一つは訓練パターンへの過適合であり、これは汎化を制限する。もう一つは文脈的不整合であり、モデルが重要な入力を優先できない事態を指す。

検証器は不確実性の下で受理/棄却の判断を下す。それはまさに信号検出理論 [2] が記述する対象であるから、我々は検証器を検出器として構築し、検出器として測定する。精神物理学の道具立て——SDTのdβ、そして適応閾値のためのWeber–Fechner弁別閾(JND)スケーリング——を、ここでは測定可能な構造として適用する。

2. 関連研究

LLMの妥当性とハルシネーション。 尤度で訓練されたモデルは、もっともらしいが裏付けのない内容を生成する。これは未解決問題として調査されており [1]、検索による接地 [10] は緩和するが除去はしない。

信号検出理論。 SDT [2] は、不確実性の下で「信号」か「雑音」かを判断する数学である。感度(d、二つの分布がどれだけ区別可能か)を基準(β、観測者が受理/棄却の線をどこに引くか)から分離し、そのトレードオフを受信者動作特性(ROC)として要約する。これは出力検証器に直接適用される。検証器は受理可能な出力を受理不可能な出力から分離し、各誤り種のコストを踏まえて線をどこに引くかを選ばねばならないからである。

Weber–FechnerとStevens。 Fechnerの対数法則 [3] とStevensのべき法則 [4] は、刺激量と知覚量とを圧縮的な尺度の上で関係づける。これらは閾値の移動が意味を持つ単位、すなわちJNDを定める。適応閾値化とは、その原理を受理/棄却境界に適用したものである。判断基準は線形の刻みではなく、JNDでスケールされた刻みで移動される。

関数合成。 検証・誤り訂正・リトライの各段階は、原子関数の上の高階関数として合成される。これは関数レベルプログラミングの標準的な意味 [5]、高階関数のモジュラリティ論 [6]、そして第一級の値としての関数 [7] における合成である。

3. 検出としての検証

LLM出力検証器は検出器である。候補出力が与えられると、それは「受理」か「棄却」かを判断する。SDT [2] はその判断を記述する二つの独立したつまみを与える。

適応閾値化は精密な操作である。すなわち検証器のROCに沿ってβを、JNDでスケールされた刻みで移動する [3]。この枠組みは、閾値適応が「できないこと」も同時に確定させる。それは検証器が持たない感度を作り出すことはできない。

4. 検証・リトライアーキテクチャ(認知DSL/IPO)

このアーキテクチャは少数の段階を合成する。各段階はいずれのソース言語でもなく、認知DSL/IPO記法——Input, Process, Output——によって記述される。合成は [5, 6] に従い抽象的である。

リトライ予算について、一つの [ILLUSTRATIVE] な恒等式を挙げる。検証器のステップごとの受理確率を a、リトライ予算を r とすれば、r 回の独立試行のうち少なくとも一つが受理される確率は 1 (1 − a)^r である。これは仮定された a の下での独立ベルヌーイ試行に対する算術である。注視すべき項は独立性の仮定である。リトライは同一のモデルを類似のプロンプトで再サンプリングするからである。

5. 測定:検出は実在し、信頼性の向上はしない

SDTの枠組みを直接検証する。結果は [MEASURED] かつ [PARTIALLY-SUPPORTED] であり、二つに分かれる。

検出は実在する。 自己一貫性検証器は、測定された感度 d = 0.72(95% CI [0.10, 1.35]、下限 > 0)、基準 β = 1.95 を達成する——受理可能な出力と受理不可能な出力とを、偶然を上回る水準で弁別する(N = 156、初回のみ、Hautus対数線形補正、等分散ガウス)。純粋な形式検証器は d 0(CIは零を含む)を示す。すなわち値の誤りを弁別しない。検出器は、形式検査が捉えられない信号を分解する。

信頼性の向上はしない。 エンドツーエンドのタスク精度は20.5%から21.8%へ動く。これは Δ = +1.3% であり、統計的に有意でない(McNemar p = 0.63)。ここでリトライがほとんど役立たないのは、モデルの誤りが大部分系統的だからである——再サンプリングは同じ誤答を再生する——ゆえに誤りを見た検出器も、再度問うことでそれを修正することはできない。

読み筋は明快である。SDT手法は真正の検出器として検証され、それが実質的な貢献である。一方でリトライ駆動の信頼性は、穏当かつ非有意な効果である。ヌルもまた証拠である。両側を測定されたとおりに報告する。

証拠と適用範囲

SDT・アズ・検出器は測定によって支えられる。自己一貫性検証器は実信号を分解し(d = 0.72 [0.10, 1.35]、β = 1.95、N = 156)、純粋な形式検証器はそうしない(d 0)。リトライ駆動の信頼性向上は小さく非有意な効果であり(Δ = +1.3%、McNemar p = 0.63)、枠組みによってではなく系統的モデル誤りによって上限を画される。SDT [2] は、あらゆる検証器が直面する受理/棄却のトレードオフを記述する。感度は、特定のタスクにおける特定の検証器を測定することで確立され、ここでは自己一貫性検出器について確立された。Weber–Fechner [3] とStevens [4] は、判断閾値が適応する対数量的尺度を定める。有界リトライループは同一の基盤モデルを再サンプリングするため、モデルが受理可能な出力を生成できない場合、ループは明示的な失敗マーカーへ収束する。「HOF認知的精神物理学的検証」は本コーパスの用語である。

参考文献

  1. Ziwei Ji et al. (2023). Survey of Hallucination in Natural Language Generation. ACM Computing Surveys. arXiv:2202.03629.
  2. David M. Green & John A. Swets (1966). Signal Detection Theory and Psychophysics. Wiley.
  3. Gustav Theodor Fechner (1860). Elemente der Psychophysik. Breitkopf und Härtel.
  4. S. S. Stevens (1957). On the Psychophysical Law. Psychological Review.
  5. John Backus (1978). Can Programming Be Liberated from the von Neumann Style? A Functional Style and Its Algebra of Programs. Communications of the ACM. [1977 ACM Turing Award Lecture]
  6. John Hughes (1989). Why Functional Programming Matters. The Computer Journal.
  7. Christopher Strachey (2000). Fundamental Concepts in Programming Languages. Higher-Order and Symbolic Computation. [Reprint of 1967 lecture notes]
  8. Ashish Vaswani et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems (NeurIPS). arXiv:1706.03762.
  9. Tom B. Brown et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.14165. [GPT-3]
  10. Patrick Lewis et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. Advances in Neural Information Processing Systems (NeurIPS). arXiv:2005.11401. [RAG]