<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>DPO :: 标签 :: x7peeps</title><link>https://x7peeps.com/tags/DPO/index.html</link><description/><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 12 Aug 2026 12:52:48 +0000</lastBuildDate><atom:link href="https://x7peeps.com/tags/DPO/index.xml" rel="self" type="application/rss+xml"/><item><title>AI 对齐技术全景：从 RLHF 到 DPO、GRPO 与可扩展监督的演进</title><link>https://x7peeps.com/AI/08-%E5%AE%89%E5%85%A8%E4%B8%8EAI%E8%9E%8D%E5%90%88/AI%E5%AF%B9%E9%BD%90%E6%8A%80%E6%9C%AF%E5%85%A8%E6%99%AF%E4%BB%8ERLHF%E5%88%B0DPOGRPO%E4%B8%8E%E5%8F%AF%E6%89%A9%E5%B1%95%E7%9B%91%E7%9D%A3%E7%9A%84%E6%BC%94%E8%BF%9B/index.html</link><pubDate>Wed, 12 Aug 2026 12:52:48 +0000</pubDate><guid>https://x7peeps.com/AI/08-%E5%AE%89%E5%85%A8%E4%B8%8EAI%E8%9E%8D%E5%90%88/AI%E5%AF%B9%E9%BD%90%E6%8A%80%E6%9C%AF%E5%85%A8%E6%99%AF%E4%BB%8ERLHF%E5%88%B0DPOGRPO%E4%B8%8E%E5%8F%AF%E6%89%A9%E5%B1%95%E7%9B%91%E7%9D%A3%E7%9A%84%E6%BC%94%E8%BF%9B/index.html</guid><description>AI 对齐技术全景：从 RLHF 到 DPO、GRPO 与可扩展监督的演进 大语言模型（LLM）的能力在过去两年经历了指数级增长——从 ChatGPT 的初代惊艳，到 GPT-4o、Claude 4、DeepSeek-R1 等模型在推理、编码、多模态领域的全面突破。然而，能力的飞速提升带来了一个根本性问题：如何确保这些强大模型的行为与人类意图保持一致？</description></item></channel></rss>