Skip to content
Blog
Archive
Search
RSS
2026-08-11
DPO 原理推导
2026-08-10
GRPO 的形式以及解决的问题
2026-08-01
Value Model 的几种训练方法
2026-07-31
Reward Model 存在的问题以及 Value Model 的作用
2026-07-28
如何将 Reward Model 得到的标量奖励转化为策略梯度