update readme

This commit is contained in:
qiwang067
2020-10-08 15:16:20 +08:00
parent 526e02cc71
commit 0bbc0d31c8

View File

@@ -2,7 +2,7 @@
悬崖寻路问题CliffWalking是指在一个4 x 12的网格中智能体以网格的左下角位置为起点以网格的下角位置为终点目标是移动智能体到达终点位置智能体每次可以在上、下、左、右这4个方向中移动一步每移动一步会得到-1单位的奖励。
<img src="assets/image-20201007211441036.png" alt="image-20201007211441036" style="zoom:50%;" />
![](assets/cliffwalking_1.png)
如图红色部分表示悬崖数字代表智能体能够观测到的位置信息即observation总共会有0-47等48个不同的值智能体再移动中会有以下限制
@@ -14,6 +14,6 @@
实际的仿真界面如下:
<img src="assets/image-20201007211858925.png" alt="image-20201007211858925" style="zoom:50%;" />
![](assets/cliffwalking_2.png)
由于从起点到终点最少需要13步每步得到-1的reward因此最佳训练算法下每个episode下reward总和应该为-13。