Gunjan Dhanuka — Learning Notes
Search
Search
Dark mode
Light mode
Reader mode
Explorer
preference-learning
3 items with this tag.
Sep 02, 2026
Bradley–Terry Model
bradley-terry
preference-learning
reward-model
dpo
rlhf
rl-for-llms
Sep 02, 2026
Reward Model
rlhf
reward-model
preference-learning
bradley-terry
reward-hacking
rl-for-llms
Sep 02, 2026
06 · The RLHF Pipeline
rlhf
reward-model
bradley-terry
instructgpt
ppo
preference-learning
alignment
reward-overoptimization