Gunjan Dhanuka — Learning Notes
Search
Search
Dark mode
Light mode
Reader mode
Explorer
bradley-terry
5 items with this tag.
Sep 02, 2026
Bradley–Terry Model
bradley-terry
preference-learning
reward-model
dpo
rlhf
rl-for-llms
Sep 02, 2026
DPO (Direct Preference Optimization)
dpo
preference-optimization
rlhf
bradley-terry
kl-regularization
alignment
rl-for-llms
Sep 02, 2026
Reward Model
rlhf
reward-model
preference-learning
bradley-terry
reward-hacking
rl-for-llms
Sep 02, 2026
06 · The RLHF Pipeline
rlhf
reward-model
bradley-terry
instructgpt
ppo
preference-learning
alignment
reward-overoptimization
Sep 02, 2026
07 · DPO & RL-Free Preference Optimization
dpo
preference-optimization
rlhf
bradley-terry
kl-regularization
ipo
kto
orpo
simpo
cpo
alignment
likelihood-displacement