Update chapter3_questions&keywords.md

This commit is contained in:
David Young
2020-09-08 09:13:44 +08:00
committed by GitHub
parent 66f2c4f35b
commit 6ef0a93232

View File

@@ -1,6 +1,6 @@
## Chapter3 表格型方法
# Chapter3 表格型方法
#### 1 关键词
## 1 Keywords
- **P函数和R函数**P函数就是状态转移的概率其就是反应的环境的随机性R函数就是Reward function。但是我们通常处于一个未知的环境即P函数和R函数是未知的
- **Q表格型表示方法** 表示形式是一种表格形式其中横坐标为actionagent的行为纵坐标是环境的state其对应着每一个时刻agent和环境的情况并通过对应的reward反馈去做选择。一般情况下Q表格是一个已经训练好的表格不过我们也可以每进行一步就更新一下Q表格然后用下一个状态的Q值来更新这个状态的Q值即时序差分方法
@@ -8,7 +8,7 @@
- **SARSA算法** 一种更新前一时刻状态的单步更新的强化学习算法也是一种on-policy策略。该算法由于每次更新值函数需要知道前一步的状态(state),前一步的动作(action)、奖励(reward)、当前状态(state)、将要执行的动作(action),即 $(S_{t}, A_{t}, R_{t+1}, S_{t+1}, A_{t+1})$ 这几个值所以被称为SARSA算法。agent没进行一次循环都会用 $(S_{t}, A_{t}, R_{t+1}, S_{t+1}, A_{t+1})$ 对于前一步的Q值函数进行一次更新。
#### 2 思考题
## 2 Questions
- 构成强化学习MDP的四元组