LLaMA-Factory/examples/lora_single_gpu/README.md

Usage:

- `pretrain.sh`
- `sft.sh` -> `reward.sh` -> `ppo.sh`
- `sft.sh` -> `dpo.sh` -> `predict.sh`