### 0
pkill -9 sglang; sleep 3; ray stop
  --force; pkill -9 ray; pkill -9 miles; sleep 3; pkill -9 ray; pkill -9 miles; pkill -9 redis; true; 

### 1
export PYTHONUNBUFFERED=1 && ray start
  --head
  --node-ip-address 127.0.0.1
  --num-gpus 4
  --disable-usage-stats

### 2
nvidia-smi topo -m 2>/dev/null | grep -o 'NV[0-9][0-9]*' | wc -l

### 3
export no_proxy=127.0.0.1 && export PYTHONUNBUFFERED=1 && ray job submit
  --address="http://127.0.0.1:8265"
  --runtime-env-json='{"env_vars": {"PYTHONUNBUFFERED": "1", "CUDA_DEVICE_MAX_CONNECTIONS": "1", "NCCL_NVLS_ENABLE": "0", "no_proxy": "127.0.0.1,127.0.0.1", "MASTER_ADDR": "127.0.0.1", "SGLANG_ENABLE_UNIFIED_RADIX_TREE": "1", "SGLANG_OPT_USE_INKLING_FUSED_AR_SCONV_NORM": "false", "SGLANG_SKIP_SGL_KERNEL_VERSION_CHECK": "1", "MILES_SGLANG_DUMMY_LOAD": "0", "SGLANG_SERVER_ENGINE_ROLLOUT_RETURN_LOGPROB": "1", "RAY_memory_monitor_refresh_ms": "0", "NCCL_MNNVL_ENABLE": "1", "NCCL_RAS_ENABLE": "0", "PYTHONPATH": "<REPO_ROOT>:/root/Megatron-LM:/frozen/pythonpath"}}'
  -- python3 <REPO_ROOT>/train.py
  --disable-bias-linear
  --num-layers 4
  --hidden-size 6144
  --ffn-hidden-size 3072
  --num-attention-heads 64
  --group-query-attention
  --num-query-groups 8
  --kv-channels 128
  --normalization RMSNorm
  --norm-epsilon 1e-6
  --swiglu
  --untie-embeddings-and-output-weights
  --vocab-size 201024
  --hidden-dropout 0.0
  --attention-dropout 0.0
  --attention-softmax-in-fp32
  --position-embedding-type none
  --no-rope-fusion
  --no-masked-softmax-fusion
  --max-position-embeddings 1048576
  --num-experts 256
  --moe-ffn-hidden-size 3072
  --moe-router-topk 6
  --moe-shared-expert-intermediate-size 3072
  --moe-router-pre-softmax
  --moe-router-score-function sigmoid
  --moe-router-enable-expert-bias
  --moe-router-load-balancing-type seq_aux_loss
  --moe-token-dispatcher-type alltoall
  --moe-aux-loss-coeff 0
  --moe-grouped-gemm
  --qk-layernorm
  --custom-model-provider-path miles_plugins.models.inkling.model.inkling_model_provider
  --hf-checkpoint /root/models/Inkling-4layer
  --load /root/models/Inkling-4layer_torch_dist
  --model-name inkling
  --megatron-to-hf-mode raw
  --no-load-optim
  --no-load-rng
  --finetune  
  --input-key prompt
  --label-key label
  --rollout-shuffle
  --rm-type math
  --num-rollout 100
  --rollout-batch-size 32
  --n-samples-per-prompt 8
  --rollout-max-response-len 4096
  --rollout-temperature 1
  --global-batch-size 64
  --balance-data
  --prompt-data /root/datasets/dapo-math-17k/dapo-math-17k.jsonl
  --apply-chat-template  
  --advantage-estimator grpo
  --entropy-coef 0.0
  --eps-clip 0.2
  --eps-clip-high 0.28
  --eps-clip-c 3.0
  --use-tis
  --use-rollout-routing-replay 
  --optimizer adam
  --lr 1e-06
  --lr-decay-style constant
  --weight-decay 0.1
  --adam-beta1 0.9
  --adam-beta2 0.98
  --use-distributed-optimizer
  --no-check-for-nan-in-loss-and-grad
  --accumulate-allreduce-grads-in-fp32
  --offload-train-target disk
  --offload-train-disk-dir /tmp/train_offload 
  --tensor-model-parallel-size 4
  --sequence-parallel
  --pipeline-model-parallel-size 1
  --expert-model-parallel-size 4
  --expert-tensor-parallel-size 1
  --recompute-granularity full
  --recompute-method uniform
  --recompute-num-layers 1
  --micro-batch-size 1  
  --rollout-num-gpus-per-engine 16
  --sglang-mem-fraction-static 0.6
  --sglang-max-running-requests 64
  --sglang-max-total-tokens 327680
  --sglang-attention-backend fa4
  --sglang-moe-runner-backend triton
  --sglang-mamba-scheduler-strategy extra_buffer
  --sglang-enable-multimodal
  --sglang-context-length 8192
  --sglang-disable-custom-all-reduce 
  --transformer-impl transformer_engine
  --bf16
  --attention-dropout 0.0
  --hidden-dropout 0.0
  --attention-softmax-in-fp32
  --no-bias-dropout-fusion
  --distributed-timeout-minutes 30
  --actor-num-nodes 1
  --actor-num-gpus-per-node 4
  --num-gpus-per-node 4
  --colocate 
  --use-wandb
  --wandb-project miles-run_inkling
  --wandb-group 260101-000000-000
  --wandb-key 'frozen-wandb-api-key'
  --disable-wandb-random-suffix   
