Commit da3a13ca authored by Bharath Ramsundar's avatar Bharath Ramsundar
Browse files

Potential fix to leakage bug

parent d00f63c7
Loading
Loading
Loading
Loading
+11 −0
Original line number Diff line number Diff line
@@ -403,6 +403,17 @@ def _df_to_numpy(df, feature_types, tasks):
      feature_list.append(datapoint[feature_type])
    try:
      features = np.squeeze(np.concatenate(feature_list))
      ################################# DEBUG
      #print("features.size: %s" % str(features.size))
      #print("features.size == 0")
      #print(features.size == 0)
      if features.size == 0:
        #print("CONTINUING")
        features = np.zeros(feature_shape)
        tensors.append(features)
        missing[ind, :] = 1
        continue
      ################################# DEBUG
      for feature_ind, val in enumerate(features):
        if features[feature_ind] == "":
          features[feature_ind] = 0.
+8 −0
Original line number Diff line number Diff line
@@ -257,6 +257,14 @@ class DataFeaturizer(object):
        if ind % self.log_every_n == 0:
          log("Featurizing sample %d" % ind, self.verbosity)
        mol = Chem.MolFromSmiles(smiles)
        ################################ DEBUG
        if mol is None:
          #print("RDKit loading failed at %s" % smiles)
          output = featurizer.featurize([mol], verbosity=self.verbosity)
          #print("featurizer returned %s" % str(output))
          #print("type(output)")
          #print(type(output))
        ################################ DEBUG
        features.append(featurizer.featurize([mol], verbosity=self.verbosity))
    else:
      def featurize_wrapper(smiles, dilled_featurizer):