Commit 284ee0a0 authored by jameskrw's avatar jameskrw Committed by YaningGao
Browse files

updated training prompts

parent a5d989ae
Loading
Loading
Loading
Loading
+1 −1
Original line number Diff line number Diff line
@@ -78,5 +78,5 @@ python3 -m vagen.trainer.main_ppo \
    rollout_manager.n_trajectory=1 \
    rollout_manager.use_service=True \
    rollout_manager.timeout=240 \
    rollout_manager.base_url="http://localhost:5001" \
    rollout_manager.base_url="http://localhost:5000" \
    2>&1 | tee aico_navigation_vision.log
 No newline at end of file
+7 −7
Original line number Diff line number Diff line
@@ -33,8 +33,8 @@ python3 -m vagen.trainer.main_ppo \
    data.train_batch_size=64 \
    data.val_batch_size=32 \
    data.max_prompt_length=1024 \
    data.max_response_length=256 \
    data.max_trajectory_length=3000 \
    data.max_response_length=150 \
    data.max_trajectory_length=4000 \
    data.image_key=images \
    data.truncation=error \
    actor_rollout_ref.model.path=Qwen/Qwen2.5-VL-3B-Instruct \
@@ -46,8 +46,8 @@ python3 -m vagen.trainer.main_ppo \
    actor_rollout_ref.actor.kl_loss_coef=0.001 \
    actor_rollout_ref.actor.kl_loss_type=mse \
    actor_rollout_ref.model.enable_gradient_checkpointing=True \
    actor_rollout_ref.actor.fsdp_config.param_offload=False \
    actor_rollout_ref.actor.fsdp_config.optimizer_offload=False \
    actor_rollout_ref.actor.fsdp_config.param_offload=True \
    actor_rollout_ref.actor.fsdp_config.optimizer_offload=True \
    actor_rollout_ref.rollout.log_prob_micro_batch_size_per_gpu=1 \
    actor_rollout_ref.rollout.tensor_model_parallel_size=4 \
    actor_rollout_ref.rollout.name=vllm \
@@ -77,8 +77,8 @@ python3 -m vagen.trainer.main_ppo \
    trainer.save_freq=90 \
    trainer.test_freq=20 \
    trainer.total_training_steps=200 \
    rollout_manager.max_turns=3 \
    rollout_manager.window_size=3 \
    rollout_manager.max_turns=4 \
    rollout_manager.window_size=4 \
    rollout_manager.use_multi_turn_reward=False \
    rollout_manager.use_loss_mask=True \
    rollout_manager.use_gae_mask=True \
@@ -87,5 +87,5 @@ python3 -m vagen.trainer.main_ppo \
    rollout_manager.n_trajectory=2 \
    rollout_manager.use_service=True \
    rollout_manager.timeout=240 \
    rollout_manager.base_url="http://localhost:5000" \
    rollout_manager.base_url="http://localhost:5001" \
    2>&1 | tee $EXPERIMENT_NAME.log
+1 −1
Original line number Diff line number Diff line
@@ -5,4 +5,4 @@ env1:
        prompt_format: free_think
        use_accuracy_reward: false
    train_size: 10000  
    test_size: 128
 No newline at end of file
    test_size: 64
 No newline at end of file
+7 −7
Original line number Diff line number Diff line
@@ -27,10 +27,10 @@ python3 -m vagen.trainer.main_ppo \
    data.train_files=data/$EXPERIMENT_NAME/train.parquet \
    data.val_files=data/$EXPERIMENT_NAME/test.parquet \
    data.train_batch_size=64 \
    data.val_batch_size=16 \
    data.val_batch_size=8 \
    data.max_prompt_length=1024 \
    data.max_response_length=256 \
    data.max_trajectory_length=3800 \
    data.max_response_length=150 \
    data.max_trajectory_length=4000 \
    data.image_key=images \
    data.truncation=error \
    actor_rollout_ref.model.path=Qwen/Qwen2.5-VL-3B-Instruct \
@@ -42,12 +42,12 @@ python3 -m vagen.trainer.main_ppo \
    actor_rollout_ref.actor.kl_loss_coef=0.001 \
    actor_rollout_ref.actor.kl_loss_type=mse \
    actor_rollout_ref.model.enable_gradient_checkpointing=True \
    actor_rollout_ref.actor.fsdp_config.param_offload=False \
    actor_rollout_ref.actor.fsdp_config.optimizer_offload=False \
    actor_rollout_ref.actor.fsdp_config.param_offload=True \
    actor_rollout_ref.actor.fsdp_config.optimizer_offload=True \
    actor_rollout_ref.rollout.log_prob_micro_batch_size_per_gpu=1 \
    actor_rollout_ref.rollout.tensor_model_parallel_size=4 \
    actor_rollout_ref.rollout.name=vllm \
    actor_rollout_ref.rollout.gpu_memory_utilization=0.3 \
    actor_rollout_ref.rollout.gpu_memory_utilization=0.1 \
    actor_rollout_ref.rollout.enable_chunked_prefill=False \
    actor_rollout_ref.rollout.enforce_eager=False \
    actor_rollout_ref.rollout.free_cache_engine=False \
@@ -83,5 +83,5 @@ python3 -m vagen.trainer.main_ppo \
    rollout_manager.n_trajectory=1 \
    rollout_manager.use_service=True \
    rollout_manager.timeout=240 \
    rollout_manager.base_url="http://localhost:5001" \
    rollout_manager.base_url="http://localhost:5000" \
    2>&1 | tee $EXPERIMENT_NAME.log
+1 −1
Original line number Diff line number Diff line
@@ -32,4 +32,4 @@ echo "Installing Frozenlake dependencies"
pip install 'gymnasium'
pip install "gymnasium[toy-text]"

echo "Installation complete, to install dependencies for other environments, refer to env/readme!"
echo "Installation complete, to install dependencies for other environments, refer to env/readme"
Loading