RLHF and Preference-Based Alignment — Fine-Tuning & Model Customizati…
Using human feedback to shape behavior
Steps in RLHF and Preference-Based Alignment
- RLHF Fundamentals — beginner · Using human feedback to shape model behavior beyond supervised fine-tuning
- Reward Modeling — beginner · Training a model to predict which outputs humans would prefer
- Direct Preference Optimization (DPO) — beginner · A simpler alternative to full RLHF for preference-based training
- Collecting Human Preference Data — beginner · Structuring a process for gathering reliable preference judgments
- Risks and Failure Modes of Alignment Training — beginner · Reward hacking and other ways alignment training can go wrong
Part of
- Fine-Tuning & Model Customization roadmap — the full learning path