VLM-as-a-Judge による XAI Plausibility 評価の検証 (MIRU2026) VLM-as-a-Judge による XAI Plausibility 評価の検証 (MIRU2026)

重藤優太郎, 吉川友也, 新保仁

説明が人間にとってどれだけ納得できるかを表す plausibility (もっともらしさ) は XAI 手法の重要な評価指標のひとつだが, その評価には通常, 人間の評価者を要する. 本研究では, 視覚言語モデル (VLM) が plausibility のゼロショット評価者となりうるかを検証する. PASTA ベンチマークでの実験により, VLM はアノテーションや学習を一切伴わずに, 教師ありベースライン PASTA-score と同等の性能を達成することを示す. さらに分布外設定では, ドメインシフト下で PASTA-score が plausibility に関連する手がかりとの相関を失う一方, VLM は一貫して正の相関を保ち, より頑健な評価挙動を示す.

Members