説明が失敗しそうな予感がする

状態+行動=報酬
状態 行動 効果 報酬 報酬量

状態13 行動13 効果13 報酬25 報酬量8

記憶
状態 行動 報酬量? 回数 上限

状態 認識 参照 行動 報酬 記憶
状態nの時に行動nをしたら報酬nが得られた