Gunjan Dhanuka — Learning Notes
Search
Search
Dark mode
Light mode
Reader mode
Explorer
deepseek-r1
3 items with this tag.
Sep 02, 2026
Chain-of-Thought RL (emergent reasoning)
chain-of-thought
reasoning
rlvr
grpo
o1
deepseek-r1
test-time-compute
rl-for-llms
Sep 02, 2026
RLVR (RL with Verifiable Rewards)
rlvr
rl
verifiable-rewards
reasoning
grpo
reward-hacking
deepseek-r1
rl-for-llms
Sep 02, 2026
09 · RL for Reasoning (RLVR, GRPO, R1)
rl
rlvr
grpo
deepseek-r1
reasoning
verifiable-rewards
chain-of-thought
process-reward-model
dapo
dr-grpo
o1
test-time-compute