Gunjan Dhanuka — Learning Notes
Search
Search
Dark mode
Light mode
Reader mode
Explorer
reward-model
7 items with this tag.
Sep 02, 2026
Bradley–Terry Model
bradley-terry
preference-learning
reward-model
dpo
rlhf
rl-for-llms
Sep 02, 2026
Process Reward Model (PRM)
prm
orm
process-supervision
reasoning
reward-model
rlvr
math-shepherd
rl-for-llms
Sep 02, 2026
Reward Model
rlhf
reward-model
preference-learning
bradley-terry
reward-hacking
rl-for-llms
Sep 02, 2026
RLAIF (RL from AI Feedback)
rlaif
llm-as-a-judge
constitutional-ai
rlhf
reward-model
alignment
rl-for-llms
Sep 02, 2026
RLHF (Reinforcement Learning from Human Feedback)
rlhf
alignment
reward-model
ppo
instructgpt
llm-training
rl-for-llms
Sep 02, 2026
06 · The RLHF Pipeline
rlhf
reward-model
bradley-terry
instructgpt
ppo
preference-learning
alignment
reward-overoptimization
Sep 02, 2026
08 · Scaling RLHF & Alternatives
rlhf
rlaif
constitutional-ai
reward-model
reward-hacking
reward-overoptimization
llm-as-a-judge
rejection-sampling
best-of-n
rest
warm
alignment