READING0%
作品一覧へ戻る

TOOL / 2026

rerpg — Abyssal Tactics

即死級攻撃と厳しいAP制約を持つJRPG戦闘を実験環境として構築し、LLM・強化学習・人間の意思決定を比較する卒業研究プロジェクトです。

担当
研究設計・戦闘環境・Web UI・RL/LLM評価・可視化
状態
研究・開発中
技術
  • Python
  • Gymnasium
  • PPO
  • Stable-Baselines3
  • React
  • TypeScript
  • TensorBoard
rerpg — Abyssal Tactics — 即死級攻撃と厳しいAP制約を持つJRPG戦闘を実験環境として構築し、LLM・強化学習・人間の意思決定を比較する卒業研究プロジェクトです。
  • 01RL・LLM・人間を同一環境で比較
  • 02DPオラクルと学術指標を実装
  • 03日・英・中の研究文書
01

課題と目標

LLM、強化学習、人間は、限られた行動資源と即死リスクの下でどのように異なる判断をするのか。この問いを定量的に比較するため、同じルール・同じ状態・同じ評価指標を共有できる実験基盤が必要でした。

02

技術的な挑戦

戦闘がゲームとして成立するだけでなく、学術実験として再現可能であることが課題でした。報酬設計による行動の歪み、LLMの数値計算ミス、最終レポートと実測値の不一致を検出できる評価経路も必要でした。

03

解決方法

Gymnasium準拠の戦闘環境、PPO学習、LLM自動プレイ、動的計画法による理論上限、React製の観察UIを一つのプロジェクトに統合しました。Baseline・詳細報酬・Potential-based Shapingを同じ指標で比較し、テストとTensorBoardログから結果を生成する構成にしました。

04

結果と学び

戦闘ロジック、学習、可視化、学術文書を往復できる再現可能な研究基盤を構築しました。単純な勝敗だけでなく、ダメージ効率、生存、回復依存、行動ミスを追跡し、「なぜその方策が強いか」を説明できる証拠の形に整理しています。