### 0
bash -c export PYTHONUNBUFFERED=1 && ray job submit
  --address="http://127.0.0.1:8265"
  --runtime-env-json='{"env_vars": {"PYTHONUNBUFFERED": "1", "PYTHONPATH": "/root/Megatron-LM/", "CUDA_DEVICE_MAX_CONNECTIONS": "1", "NCCL_NVLS_ENABLE": "1"}}'
  -- python3 train.py
  --swiglu
  --num-layers 36
  --hidden-size 4096
  --ffn-hidden-size 12288
  --num-attention-heads 32
  --group-query-attention
  --num-query-groups 8
  --use-rotary-position-embeddings
  --disable-bias-linear
  --normalization RMSNorm
  --norm-epsilon 1e-6
  --rotary-base 1000000
  --vocab-size 151936
  --kv-channels 128
  --qk-layernorm
  --untie-embeddings-and-output-weights
  --hf-checkpoint /root/models/Qwen3-8B/
  --ref-load /root/models/Qwen3-8B_torch_dist
  --save-interval 20
  --load /root/Qwen3-8B_miles
  --save /root/Qwen3-8B_miles 
  --prompt-data /root/datasets/formal_math_single_round/minimal_demo/flc_train.jsonl
  --input-key prompt
  --apply-chat-template
  --rollout-shuffle
  --custom-rm-path examples.experimental.formal_math.single_round.reward_fn.reward_fn
  --reward-key reward_value
  --log-reward-category reward_cat
  --rollout-batch-size 32
  --n-samples-per-prompt 8
  --rollout-max-response-len 8192
  --rollout-temperature 1
  --global-batch-size 256
  --balance-data
  --num-rollout 3000 
  --optimizer adam
  --lr 1e-6
  --lr-decay-style constant
  --weight-decay 0.1
  --adam-beta1 0.9
  --adam-beta2 0.98 
  --advantage-estimator grpo
  --use-kl-loss
  --kl-loss-coef 0.00
  --kl-loss-type low_var_kl
  --entropy-coef 0.00
  --eps-clip 0.2
  --eps-clip-high 0.28 
  --use-wandb
  --wandb-project miles-formal-math-run-minimal
  --wandb-group demo
  --wandb-key 'frozen-wandb-api-key' 
  --tensor-model-parallel-size 2
  --sequence-parallel
  --pipeline-model-parallel-size 1
  --context-parallel-size 1
  --expert-model-parallel-size 1
  --expert-tensor-parallel-size 1
  --recompute-granularity full
  --recompute-method uniform
  --recompute-num-layers 1
  --use-dynamic-batch-size
  --max-tokens-per-gpu 6144 
  --eval-interval 20
  --n-samples-per-eval-prompt 1
  --eval-max-response-len 16384
  --eval-top-p 1
  --eval-prompt-data minif2f /root/datasets/formal_math_single_round/minimal_demo/minif2f_test.jsonl 
  --rollout-num-gpus-per-engine 8
  --sglang-mem-fraction-static 0.7 
  --attention-dropout 0.0
  --hidden-dropout 0.0
  --accumulate-allreduce-grads-in-fp32
  --attention-softmax-in-fp32
  --attention-backend flash
  --actor-num-nodes 1
  --actor-num-gpus-per-node 8
  --colocate
  --log-passrate  
