Gunjan Dhanuka — Learning Notes
Search
Search
Dark mode
Light mode
Reader mode
Explorer
policy-gradient
6 items with this tag.
Sep 02, 2026
Advantage Function
reinforcement-learning
advantage
variance-reduction
policy-gradient
rl-for-llms
Sep 02, 2026
Policy Gradient Theorem
reinforcement-learning
policy-gradient
score-function
rlhf
rl-for-llms
Sep 02, 2026
PPO (Proximal Policy Optimization)
rl
ppo
trust-region
policy-gradient
rlhf
importance-sampling
rl-for-llms
Sep 02, 2026
REINFORCE
reinforcement-learning
policy-gradient
reinforce
monte-carlo
rlhf
rl-for-llms
Sep 02, 2026
02 · Policy Gradients
reinforcement-learning
policy-gradient
reinforce
baselines
variance-reduction
rlhf
Sep 02, 2026
04 · PPO
rl
ppo
trpo
trust-region
policy-gradient
rlhf
importance-sampling