From 0bbc0d31c85399cc6981e51fb8490f80ce32d98b Mon Sep 17 00:00:00 2001
From: qiwang067 <qiwang067@163.com>
Date: Thu, 8 Oct 2020 15:16:20 +0800
Subject: [PATCH] update readme

---
 codes/Q-learning/README.md | 4 ++--
 1 file changed, 2 insertions(+), 2 deletions(-)
diff --git a/codes/Q-learning/README.md b/codes/Q-learning/README.md
index 0f6a87c..4fb7748 100644
--- a/codes/Q-learning/README.md
+++ b/codes/Q-learning/README.md
@@ -2,7 +2,7 @@
 
 悬崖寻路问题（CliffWalking）是指在一个4 x 12的网格中，智能体以网格的左下角位置为起点，以网格的下角位置为终点，目标是移动智能体到达终点位置，智能体每次可以在上、下、左、右这4个方向中移动一步，每移动一步会得到-1单位的奖励。
 
-<img src="assets/image-20201007211441036.png" alt="image-20201007211441036" style="zoom:50%;" />
+![](assets/cliffwalking_1.png)
 
 如图，红色部分表示悬崖，数字代表智能体能够观测到的位置信息，即observation，总共会有0-47等48个不同的值，智能体再移动中会有以下限制：
 
@@ -14,6 +14,6 @@
 
 实际的仿真界面如下：
 
-<img src="assets/image-20201007211858925.png" alt="image-20201007211858925" style="zoom:50%;" />
+![](assets/cliffwalking_2.png)
 
 由于从起点到终点最少需要13步，每步得到-1的reward，因此最佳训练算法下，每个episode下reward总和应该为-13。
\ No newline at end of file