Gunjan Dhanuka — Learning Notes
Search
Search
Dark mode
Light mode
Reader mode
Explorer
reward-hacking
5 items with this tag.
Sep 02, 2026
KL Regularization in RLHF
rlhf
kl-divergence
reward-hacking
reference-policy
ppo
rl-for-llms
Sep 02, 2026
Reward Model
rlhf
reward-model
preference-learning
bradley-terry
reward-hacking
rl-for-llms
Sep 02, 2026
Reward Overoptimization (Goodhart)
reward-overoptimization
reward-hacking
goodhart
scaling-laws
warm
kl-regularization
rl-for-llms
Sep 02, 2026
RLVR (RL with Verifiable Rewards)
rlvr
rl
verifiable-rewards
reasoning
grpo
reward-hacking
deepseek-r1
rl-for-llms
Sep 02, 2026
08 · Scaling RLHF & Alternatives
rlhf
rlaif
constitutional-ai
reward-model
reward-hacking
reward-overoptimization
llm-as-a-judge
rejection-sampling
best-of-n
rest
warm
alignment