Chris Liu
News
Papers
Services
Posts
←
rl
2026-03-02
Off-Policy Drift in LLM RL
2024-01-28
Deriving Direct Preference Optimization
2020-12-24
Deriving Policy Gradient