- 01RL・LLM・人間を同一環境で比較
- 02DPオラクルと学術指標を実装
- 03日・英・中の研究文書
課題と目標
LLM、強化学習、人間は、限られた行動資源と即死リスクの下でどのように異なる判断をするのか。この問いを定量的に比較するため、同じルール・同じ状態・同じ評価指標を共有できる実験基盤が必要でした。
技術的な挑戦
戦闘がゲームとして成立するだけでなく、学術実験として再現可能であることが課題でした。報酬設計による行動の歪み、LLMの数値計算ミス、最終レポートと実測値の不一致を検出できる評価経路も必要でした。
解決方法
Gymnasium準拠の戦闘環境、PPO学習、LLM自動プレイ、動的計画法による理論上限、React製の観察UIを一つのプロジェクトに統合しました。Baseline・詳細報酬・Potential-based Shapingを同じ指標で比較し、テストとTensorBoardログから結果を生成する構成にしました。
結果と学び
戦闘ロジック、学習、可視化、学術文書を往復できる再現可能な研究基盤を構築しました。単純な勝敗だけでなく、ダメージ効率、生存、回復依存、行動ミスを追跡し、「なぜその方策が強いか」を説明できる証拠の形に整理しています。
