Gunjan Dhanuka — Learning Notes

reward-hacking

5 items with this tag.

  • Sep 02, 2026

    KL Regularization in RLHF

    • rlhf
    • kl-divergence
    • reward-hacking
    • reference-policy
    • ppo
    • rl-for-llms
  • Sep 02, 2026

    Reward Model

    • rlhf
    • reward-model
    • preference-learning
    • bradley-terry
    • reward-hacking
    • rl-for-llms
  • Sep 02, 2026

    Reward Overoptimization (Goodhart)

    • reward-overoptimization
    • reward-hacking
    • goodhart
    • scaling-laws
    • warm
    • kl-regularization
    • rl-for-llms
  • Sep 02, 2026

    RLVR (RL with Verifiable Rewards)

    • rlvr
    • rl
    • verifiable-rewards
    • reasoning
    • grpo
    • reward-hacking
    • deepseek-r1
    • rl-for-llms
  • Sep 02, 2026

    08 · Scaling RLHF & Alternatives

    • rlhf
    • rlaif
    • constitutional-ai
    • reward-model
    • reward-hacking
    • reward-overoptimization
    • llm-as-a-judge
    • rejection-sampling
    • best-of-n
    • rest
    • warm
    • alignment

Created with Quartz v5.0.0 © 2026

  • Personal site
  • Research
  • Field notes
  • Source