Skip to content
博客
归档
搜索
RSS
2026 年 8 月 11 日
DPO 原理推导
2026 年 8 月 10 日
GRPO 的形式以及解决的问题
2026 年 8 月 1 日
Value Model 的几种训练方法
2026 年 7 月 31 日
Reward Model 存在的问题以及 Value Model 的作用
2026 年 7 月 28 日
如何将 Reward Model 得到的标量奖励转化为策略梯度