LLM Training Stages
Pretraining → SFT → preference data → RLHF / DPO → deployment.
Rendering…
Make it your own.
flowchart LR
Web[Web corpus 1-10T tokens] --> Pre[Pretraining\nnext-token prediction]
Pre --> Base[Base model]
SFTd[SFT prompt/response pairs] --> SFT[Supervised fine-tuning]
Base --> SFT
SFT --> Inst[Instruct model]
Pref["Preference pairs<br/>(human or AI)"] --> Reward[Reward model]
Inst --> RL[RLHF / DPO]
Reward --> RL
RL --> Aligned[Aligned model]
Aligned --> Eval[Evaluations\n+ red team]
Eval --> Deploy[Deploy]