Commit cd9c2149 authored by jameskrw's avatar jameskrw
Browse files

udpate align cube with no success at begin

parent 8195bd81
Loading
Loading
Loading
Loading
+6 −4
Original line number Diff line number Diff line
@@ -73,12 +73,14 @@ class AlignTwoCubeEnv(BaseEnv):

            xyz = torch.zeros((b, 3))
            xyz[:, 2] = 0.02
            region =[[self.workspace_x[0]+0.1,self.workspace_y[0]],[self.workspace_x[1],self.workspace_y[1]]]
            sampler = randomization.UniformPlacementSampler(bounds=region, batch_size=b)
            region_1 =[[self.workspace_x[0],self.workspace_y[0]],[self.workspace_x[0]+0.05,self.workspace_y[1]]]
            sampler_1 = randomization.UniformPlacementSampler(bounds=region_1, batch_size=b)
            region_2 =[[0.05,self.workspace_y[0]],[self.workspace_x[1],self.workspace_y[1]]]
            sampler_2 = randomization.UniformPlacementSampler(bounds=region_2, batch_size=b)
            radius = torch.linalg.norm(torch.tensor([0.02, 0.02])) + 0.02
            
            red_cube_xy = sampler.sample(radius, 100)
            green_cube_xy = sampler.sample(radius, 100, verbose=False)
            red_cube_xy = sampler_1.sample(radius, 100)
            green_cube_xy = sampler_2.sample(radius, 100, verbose=False)
            
            
            
+4 −4
Original line number Diff line number Diff line
@@ -18,10 +18,10 @@ python -m vagen.trainer.main_ppo \
    algorithm.high_level_gamma=0.95 \
    data.train_files=data/navigation-vision-debug/train.parquet \
    data.val_files=data/navigation-vision-debug/test.parquet \
    data.train_batch_size=64 \
    data.train_batch_size=8 \
    data.max_prompt_length=1024 \
    data.max_response_length=128 \
    data.max_trajectory_length=1800 \
    data.max_trajectory_length=1024 \
    data.image_key=images \
    data.truncation=error \
    actor_rollout_ref.model.path=Qwen/Qwen2.5-0.5B-Instruct \
@@ -38,7 +38,7 @@ python -m vagen.trainer.main_ppo \
    actor_rollout_ref.rollout.log_prob_micro_batch_size_per_gpu=1 \
    actor_rollout_ref.rollout.tensor_model_parallel_size=1 \
    actor_rollout_ref.rollout.name=vllm \
    actor_rollout_ref.rollout.gpu_memory_utilization=0.3 \
    actor_rollout_ref.rollout.gpu_memory_utilization=0.2 \
    actor_rollout_ref.rollout.enable_chunked_prefill=False \
    actor_rollout_ref.rollout.enforce_eager=False \
    actor_rollout_ref.rollout.free_cache_engine=False \
@@ -70,6 +70,6 @@ python -m vagen.trainer.main_ppo \
    rollout_manager.use_loss_mask=True \
    trainer.val_before_train=True \
    trainer.val_generations_to_log_to_wandb=8 \
    rollout_manager.n_trajectory=1 \
    rollout_manager.n_trajectory=16 \
    rollout_manager.use_service=True \
    2>&1 | tee grpo_mask_loss_primitive_skill_text_debug.log