Commit b001cae8 authored by Bharath Ramsundar's avatar Bharath Ramsundar
Browse files

Updating examples

parent 18138603
Loading
Loading
Loading
Loading
+0 −1
Original line number Diff line number Diff line
@@ -143,4 +143,3 @@ def load_pickle_from_disk(filename):
    with open(filename, "rb") as f:
      df = pickle.load(f)
  return df
+5 −7
Original line number Diff line number Diff line
@@ -19,12 +19,11 @@ def load_delaney(featurizer='ECFP', split='index'):
      current_dir, "../../datasets/delaney-processed.csv")
  delaney_tasks = ['measured log solubility in mols per litre']
  if featurizer == 'ECFP':
    featurizer_func = dc.feat.CircularFingerprint(size=1024)
    featurizer = dc.feat.CircularFingerprint(size=1024)
  elif featurizer == 'GraphConv':
    featurizer_func = dc.feat.ConvMolFeaturizer()
  loader = dc.load.DataLoader(
      tasks=delaney_tasks, smiles_field="smiles",
      featurizer=featurizer_func, verbosity = 'high')
    featurizer = dc.feat.ConvMolFeaturizer()
  loader = dc.data.DataLoader(
      tasks=delaney_tasks, smiles_field="smiles", featurizer=featurizer)
  dataset = loader.featurize(
      dataset_file, shard_size=8192)

@@ -40,6 +39,5 @@ def load_delaney(featurizer='ECFP', split='index'):
               'random': dc.splits.RandomSplitter(),
               'scaffold': dc.splits.ScaffoldSplitter()}
  splitter = splitters[split]
  train, valid, test = splitter.train_valid_test_split(dataset,
      compute_feature_statistics=False)
  train, valid, test = splitter.train_valid_test_split(dataset)
  return delaney_tasks, (train, valid, test), transformers
+2 −3
Original line number Diff line number Diff line
@@ -50,9 +50,8 @@ def load_kaggle(shard_size=2000, num_shards_per_batch=4,
                  'NK1', 'OX1', 'OX2', 'PGP', 'PPB', 'RAT_F', 'TDI',
                  'THROMBIN']

  loader = dc.load.DataLoader(
      tasks=KAGGLE_tasks, id_field="Molecule",
      featurizer=featurizer, verbosity="high")
  loader = dc.data.DataLoader(
      tasks=KAGGLE_tasks, id_field="Molecule", featurizer=featurizer)
  train_datasets, valid_datasets, test_datasets = [], [], []
  print("Featurizing train datasets")
  train_dataset = loader.featurize(
+12 −20
Original line number Diff line number Diff line
@@ -29,9 +29,8 @@ def load_tox21_ecfp(num_train=7200):
                 'NR-ER-LBD', 'NR-PPAR-gamma', 'SR-ARE', 'SR-ATAD5',
                 'SR-HSE', 'SR-MMP', 'SR-p53']

  loader = dc.load.DataLoader(
      tasks=tox21_tasks, smiles_field="smiles", featurizer=featurizer,
      verbosity="high")
  loader = dc.data.DataLoader(
      tasks=tox21_tasks, smiles_field="smiles", featurizer=featurizer)
  dataset = loader.featurize(
      dataset_file, shard_size=8192)

@@ -59,9 +58,8 @@ def load_tox21_convmol(base_dir=None, num_train=7200):
                 'NR-ER-LBD', 'NR-PPAR-gamma', 'SR-ARE', 'SR-ATAD5',
                 'SR-HSE', 'SR-MMP', 'SR-p53']

  loader = dc.load.DataLoader(
      tasks=tox21_tasks, smiles_field="smiles",
      featurizer=featurizer, verbosity="high")
  loader = dc.data.DataLoader(
      tasks=tox21_tasks, smiles_field="smiles", featurizer=featurizer)
  dataset = loader.featurize(
      dataset_file, shard_size=8192)

@@ -90,9 +88,8 @@ def load_muv_ecfp():
                      'MUV-737', 'MUV-858', 'MUV-713', 'MUV-733', 'MUV-652',
                      'MUV-466', 'MUV-832'])

  loader = dc.load.DataLoader(
      tasks=MUV_tasks, smiles_field="smiles",
      featurizer=featurizer, verbosity="high")
  loader = dc.data.DataLoader(
      tasks=MUV_tasks, smiles_field="smiles", featurizer=featurizer)
  dataset = loader.featurize(dataset_file)

  # Initialize transformers 
@@ -119,9 +116,8 @@ def load_muv_convmol():
                      'MUV-737', 'MUV-858', 'MUV-713', 'MUV-733', 'MUV-652',
                      'MUV-466', 'MUV-832'])

  loader = dc.load.DataLoader(
      tasks=MUV_tasks, smiles_field="smiles",
      featurizer=featurizer, verbosity="high")
  loader = dc.data.DataLoader(
      tasks=MUV_tasks, smiles_field="smiles", featurizer=featurizer)
  dataset = loader.featurize(dataset_file)

  # Initialize transformers 
@@ -148,10 +144,8 @@ def load_sider_ecfp():
  print("%d tasks in total" % len(SIDER_tasks))


  loader = dc.load.DataLoader(tasks=SIDER_tasks,
                      smiles_field="smiles",
                      featurizer=featurizer,
                      verbosity="high")
  loader = dc.data.DataLoader(
      tasks=SIDER_tasks, smiles_field="smiles", featurizer=featurizer)
  dataset = loader.featurize(dataset_file)
  print("%d datapoints in SIDER dataset" % len(dataset))

@@ -179,10 +173,8 @@ def load_sider_convmol():
  print("%d tasks in total" % len(SIDER_tasks))


  loader = dc.load.DataLoader(tasks=SIDER_tasks,
                      smiles_field="smiles",
                      featurizer=featurizer,
                      verbosity="high")
  loader = dc.data.DataLoader(
      tasks=SIDER_tasks, smiles_field="smiles", featurizer=featurizer)
  dataset = loader.featurize(dataset_file, debug=True)
  print("%d datapoints in SIDER dataset" % len(dataset))

+3 −5
Original line number Diff line number Diff line
@@ -30,9 +30,8 @@ def load_muv(featurizer='ECFP', split='index'):
                      'MUV-737', 'MUV-858', 'MUV-713', 'MUV-733', 'MUV-652',
                      'MUV-466', 'MUV-832'])

  loader = dc.load.DataLoader(
      tasks=MUV_tasks, smiles_field="smiles",
      featurizer=featurizer_func, verbosity="high")
  loader = dc.data.DataLoader(
      tasks=MUV_tasks, smiles_field="smiles", featurizer=featurizer_func)
  dataset = loader.featurize(dataset_file)

  # Initialize transformers 
@@ -46,8 +45,7 @@ def load_muv(featurizer='ECFP', split='index'):
               'random': dc.splits.RandomSplitter(),
               'scaffold': dc.splits.ScaffoldSplitter()}
  splitter = splitters[split]
  train, valid, test = splitter.train_valid_test_split(
	dataset, compute_feature_statistics=False)
  train, valid, test = splitter.train_valid_test_split(dataset)
  return MUV_tasks, (train, valid, test), transformers


Loading