TAG / GRPOGRPO2 篇文章,按最近更新排序。领域 全部领域ai 年份 全部年份2026 内容类型 全部类型ai 重置筛选2 篇文章AI 对齐技术全景:从 RLHF 到 DPO、GRPO 与可扩展监督的演进ai 2026-08-01推理模型技术范式:从 Chain-of-Thought 到 Test-Time Compute Scalingai 2026-07-07