|
| 1 | +""" |
| 2 | +Reinforcement learning maze example. |
| 3 | +
|
| 4 | +Red rectangle: explorer. |
| 5 | +Black rectangles: hells [reward = -1]. |
| 6 | +Yellow bin circle: paradise [reward = +1]. |
| 7 | +All other states: ground [reward = 0]. |
| 8 | +
|
| 9 | +This script is the environment part of this example. The RL is in RL_brain.py. |
| 10 | +
|
| 11 | +View more on 莫烦Python: https://morvanzhou.github.io/tutorials/ |
| 12 | +""" |
| 13 | + |
| 14 | + |
| 15 | +import numpy as np |
| 16 | +np.random.seed(1) |
| 17 | +import tkinter as tk |
| 18 | +import time |
| 19 | + |
| 20 | + |
| 21 | +UNIT = 40 # pixels |
| 22 | +MAZE_H = 4 # grid height |
| 23 | +MAZE_W = 4 # grid width |
| 24 | + |
| 25 | + |
| 26 | +class Maze(tk.Tk, object): |
| 27 | + def __init__(self): |
| 28 | + super(Maze, self).__init__() |
| 29 | + self.action_space = ['u', 'd', 'l', 'r'] |
| 30 | + self.n_actions = len(self.action_space) |
| 31 | + self.title('maze') |
| 32 | + self.geometry('{0}x{1}'.format(MAZE_H * UNIT, MAZE_H * UNIT)) |
| 33 | + self._build_maze() |
| 34 | + |
| 35 | + def _build_maze(self): |
| 36 | + self.canvas = tk.Canvas(self, bg='white', |
| 37 | + height=MAZE_H * UNIT, |
| 38 | + width=MAZE_W * UNIT) |
| 39 | + |
| 40 | + # create grids |
| 41 | + for c in range(0, MAZE_W * UNIT, UNIT): |
| 42 | + x0, y0, x1, y1 = c, 0, c, MAZE_H * UNIT |
| 43 | + self.canvas.create_line(x0, y0, x1, y1) |
| 44 | + for r in range(0, MAZE_H * UNIT, UNIT): |
| 45 | + x0, y0, x1, y1 = 0, r, MAZE_H * UNIT, r |
| 46 | + self.canvas.create_line(x0, y0, x1, y1) |
| 47 | + |
| 48 | + # create origin |
| 49 | + origin = np.array([20, 20]) |
| 50 | + |
| 51 | + # hell |
| 52 | + hell1_center = origin + np.array([UNIT * 2, UNIT]) |
| 53 | + self.hell1 = self.canvas.create_rectangle( |
| 54 | + hell1_center[0] - 15, hell1_center[1] - 15, |
| 55 | + hell1_center[0] + 15, hell1_center[1] + 15, |
| 56 | + fill='black') |
| 57 | + # hell |
| 58 | + hell2_center = origin + np.array([UNIT, UNIT * 2]) |
| 59 | + self.hell2 = self.canvas.create_rectangle( |
| 60 | + hell2_center[0] - 15, hell2_center[1] - 15, |
| 61 | + hell2_center[0] + 15, hell2_center[1] + 15, |
| 62 | + fill='black') |
| 63 | + |
| 64 | + # create oval |
| 65 | + oval_center = origin + UNIT * 2 |
| 66 | + self.oval = self.canvas.create_oval( |
| 67 | + oval_center[0] - 15, oval_center[1] - 15, |
| 68 | + oval_center[0] + 15, oval_center[1] + 15, |
| 69 | + fill='yellow') |
| 70 | + |
| 71 | + # create red rect |
| 72 | + self.rect = self.canvas.create_rectangle( |
| 73 | + origin[0] - 15, origin[1] - 15, |
| 74 | + origin[0] + 15, origin[1] + 15, |
| 75 | + fill='red') |
| 76 | + |
| 77 | + # pack all |
| 78 | + self.canvas.pack() |
| 79 | + |
| 80 | + def reset(self): |
| 81 | + self.update() |
| 82 | + time.sleep(0.5) |
| 83 | + self.canvas.delete(self.rect) |
| 84 | + origin = np.array([20, 20]) |
| 85 | + self.rect = self.canvas.create_rectangle( |
| 86 | + origin[0] - 15, origin[1] - 15, |
| 87 | + origin[0] + 15, origin[1] + 15, |
| 88 | + fill='red') |
| 89 | + # return observation |
| 90 | + return self.canvas.coords(self.rect) |
| 91 | + |
| 92 | + def step(self, action): |
| 93 | + s = self.canvas.coords(self.rect) |
| 94 | + base_action = np.array([0, 0]) |
| 95 | + if action == 0: # up |
| 96 | + if s[1] > UNIT: |
| 97 | + base_action[1] -= UNIT |
| 98 | + elif action == 1: # down |
| 99 | + if s[1] < (MAZE_H - 1) * UNIT: |
| 100 | + base_action[1] += UNIT |
| 101 | + elif action == 2: # right |
| 102 | + if s[0] < (MAZE_W - 1) * UNIT: |
| 103 | + base_action[0] += UNIT |
| 104 | + elif action == 3: # left |
| 105 | + if s[0] > UNIT: |
| 106 | + base_action[0] -= UNIT |
| 107 | + |
| 108 | + self.canvas.move(self.rect, base_action[0], base_action[1]) # move agent |
| 109 | + |
| 110 | + s_ = self.canvas.coords(self.rect) # next state |
| 111 | + |
| 112 | + # reward function |
| 113 | + if s_ == self.canvas.coords(self.oval): |
| 114 | + reward = 1 |
| 115 | + done = True |
| 116 | + elif s_ in [self.canvas.coords(self.hell1), self.canvas.coords(self.hell2)]: |
| 117 | + reward = -1 |
| 118 | + done = True |
| 119 | + else: |
| 120 | + reward = 0 |
| 121 | + done = False |
| 122 | + |
| 123 | + return s_, reward, done |
| 124 | + |
| 125 | + def render(self): |
| 126 | + # time.sleep(0.1) |
| 127 | + self.update() |
| 128 | + |
| 129 | + |
0 commit comments