Commit 2d89c822 authored by jameskrw's avatar jameskrw
Browse files

rename multi-turn-gae to bi-level-gae

parent 424ed966
Loading
Loading
Loading
Loading
+1 −1
Original line number Diff line number Diff line
@@ -22,7 +22,7 @@ python -m vagen.env.sokoban.create_dataset \
# max_trajectory_length = max_prompt_length + max_response_length

python3 -m vagen.trainer.main_ppo \
    algorithm.adv_estimator=multi_turn_gae \
    algorithm.adv_estimator=bi_level_gae \
    algorithm.high_level_gamma=0.95 \
    data.train_files=data/sokoban-vision-6-step/train.parquet \
    data.val_files=data/sokoban-vision-6-step/test.parquet \
+1 −1
Original line number Diff line number Diff line
@@ -22,7 +22,7 @@ python -m vagen.env.sokoban.create_dataset \
# max_trajectory_length = max_prompt_length + max_response_length

python3 -m vagen.trainer.main_ppo \
    algorithm.adv_estimator=multi_turn_gae \
    algorithm.adv_estimator=bi_level_gae \
    algorithm.high_level_gamma=0.95 \
    data.train_files=data/sokoban-vision-6-step/train.parquet \
    data.val_files=data/sokoban-vision-6-step/test.parquet \
+1 −1
Original line number Diff line number Diff line
@@ -26,7 +26,7 @@ fi
# max_trajectory_length = max_prompt_length + max_response_length

python3 -m vagen.trainer.main_ppo \
    algorithm.adv_estimator=multi_turn_gae \
    algorithm.adv_estimator=bi_level_gae \
    algorithm.high_level_gamma=0.95 \
    data.train_files=data/sokoban-text-1-step/train.parquet \
    data.val_files=data/sokoban-text-1-step/test.parquet \
+3 −3
Original line number Diff line number Diff line
@@ -24,7 +24,7 @@ if [ $? -ne 0 ]; then
fi

python3 -m vagen.trainer.main_ppo \
    algorithm.adv_estimator=multi_turn_gae \
    algorithm.adv_estimator=bi_level_gae \
    algorithm.high_level_gamma=0.95 \
    data.train_files=data/sokoban-text-3-step/train.parquet \
    data.val_files=data/sokoban-text-3-step/test.parquet \
@@ -68,7 +68,7 @@ python3 -m vagen.trainer.main_ppo \
    trainer.critic_warmup=0 \
    trainer.logger=['console','wandb'] \
    trainer.project_name='vagen' \
    trainer.experiment_name='debug_single_action_3_turns_ppo_3B_multi_turn_gae_temp_0.7_top_p_0.95' \
    trainer.experiment_name='debug_single_action_3_turns_ppo_3B_bi_level_gae_temp_0.7_top_p_0.95' \
    trainer.n_gpus_per_node=4 \
    trainer.nnodes=1 \
    trainer.save_freq=400 \
@@ -79,4 +79,4 @@ python3 -m vagen.trainer.main_ppo \
    trainer.val_before_train=True \
    trainer.val_generations_to_log_to_wandb=8 \
    rollout_manager.n_trajectory=1 \
    2>&1 | tee debug_single_action_3_turns_ppo_3B_multi_turn_gae_temp_0.7_top_p_0.95.log
    2>&1 | tee debug_single_action_3_turns_ppo_3B_bi_level_gae_temp_0.7_top_p_0.95.log
+3 −3
Original line number Diff line number Diff line
@@ -26,7 +26,7 @@ fi
# max_trajectory_length = max_prompt_length + max_response_length

python3 -m vagen.trainer.main_ppo \
    algorithm.adv_estimator=multi_turn_gae \
    algorithm.adv_estimator=bi_level_gae \
    algorithm.high_level_gamma=0.95 \
    data.train_files=data/sokoban-text-5-step/train.parquet \
    data.val_files=data/sokoban-text-5-step/test.parquet \
@@ -68,7 +68,7 @@ python3 -m vagen.trainer.main_ppo \
    trainer.critic_warmup=0 \
    trainer.logger=['console','wandb'] \
    trainer.project_name='vagen' \
    trainer.experiment_name='debug_single_action_5_turn_ppo_kl_multi_turn_gae' \
    trainer.experiment_name='debug_single_action_5_turn_ppo_kl_bi_level_gae' \
    trainer.n_gpus_per_node=2 \
    trainer.nnodes=1 \
    trainer.save_freq=100 \
@@ -79,4 +79,4 @@ python3 -m vagen.trainer.main_ppo \
    trainer.val_before_train=True \
    trainer.val_generations_to_log_to_wandb=8 \
    rollout_manager.n_trajectory=2 \
    2>&1 | tee debug_single_action_5_turn_ppo_kl_multi_turn_gae.log
    2>&1 | tee debug_single_action_5_turn_ppo_kl_bi_level_gae.log
Loading