Gunjan Dhanuka — Learning Notes

preference-learning

3 items with this tag.

  • Sep 02, 2026

    Bradley–Terry Model

    • bradley-terry
    • preference-learning
    • reward-model
    • dpo
    • rlhf
    • rl-for-llms
  • Sep 02, 2026

    Reward Model

    • rlhf
    • reward-model
    • preference-learning
    • bradley-terry
    • reward-hacking
    • rl-for-llms
  • Sep 02, 2026

    06 · The RLHF Pipeline

    • rlhf
    • reward-model
    • bradley-terry
    • instructgpt
    • ppo
    • preference-learning
    • alignment
    • reward-overoptimization

Created with Quartz v5.0.0 © 2026

  • Personal site
  • Research
  • Field notes
  • Source