Commit fce2a7e1 authored by Karl Leswing's avatar Karl Leswing
Browse files

Epsilon to loss function

parent 131be999
Loading
Loading
Loading
Loading
+2 −0
Original line number Diff line number Diff line
@@ -3,6 +3,7 @@ import numpy as np
import random
import tensorflow as tf
import time
import copy

from deepchem.models.tensorgraph.layers import Flatten, Dense, SoftMax, \
  Variable, \
@@ -35,6 +36,7 @@ class TicTacToeEnvironment(dc.rl.Environment):
      self._state[0][move[0]][move[1]] = TicTacToeEnvironment.O

  def step(self, action):
    self._state = copy.deepcopy(self._state)
    row = action // 3
    col = action % 3

+2 −2
Original line number Diff line number Diff line
@@ -22,7 +22,7 @@ class A3CLoss(Layer):

  def create_tensor(self, **kwargs):
    reward, action, prob, value = [layer.out_tensor for layer in self.in_layers]
    log_prob = tf.log(prob)
    log_prob = tf.log(prob + 0.0001)
    policy_loss = -tf.reduce_sum(
        (reward - value) * tf.reduce_sum(action * log_prob))
    value_loss = tf.reduce_sum(tf.square(reward - value))
@@ -263,7 +263,7 @@ class _Worker(object):
    for i in range(self.a3c.max_rollout_length):
      if self.env.terminated:
        break
      state = copy.deepcopy(self.env.state)
      state = self.env.state
      for j in range(len(state)):
        states[j].append(state[j])
      feed_dict = _create_feed_dict(self.features, state)