<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>ASI-Bench 本地横评方法论：信息梯度与决策归因评测的完整拆解 :: x7peeps</title><link>https://x7peeps.com/AI/01-LLM%E5%8E%9F%E7%90%86%E4%B8%8E%E5%B7%A5%E7%A8%8B/ASI-Bench%E6%9C%AC%E5%9C%B0%E6%A8%AA%E8%AF%84%E6%96%B9%E6%B3%95%E8%AE%BA%E4%BF%A1%E6%81%AF%E6%A2%AF%E5%BA%A6%E4%B8%8E%E5%86%B3%E7%AD%96%E5%BD%92%E5%9B%A0%E8%AF%84%E6%B5%8B%E7%9A%84%E5%AE%8C%E6%95%B4%E6%8B%86%E8%A7%A3/index.html</link><description>ASI-Bench 本地横评方法论：信息梯度与决策归因评测的完整拆解 导读：给普通读者的一句话定位——这不是一篇讲某个新模型的文章，而是一篇讲"怎么科学地评测本地模型"的方法论文。当你手上有两个本地模型，想知道"谁更聪明、谁更会自己想办法"，凭感觉跑几轮对话下结论是远远不够的。本文记录一套完整的本地化横评方法论：用信息梯度（Information Gradient）与决策归因（Decision Attribution）两个维度，把"模型能否自己想到正确方法"这件事量化出来，并在两个本地模型（35B MoE 与 27B chat）上完成了 40 次跑通的实测。文中包含实验设计、完整数据表、以及三个最容易被忽略的方法论陷阱——这些陷阱不避开，你的评测结果就是假的。</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate/><atom:link href="https://x7peeps.com/AI/01-LLM%E5%8E%9F%E7%90%86%E4%B8%8E%E5%B7%A5%E7%A8%8B/ASI-Bench%E6%9C%AC%E5%9C%B0%E6%A8%AA%E8%AF%84%E6%96%B9%E6%B3%95%E8%AE%BA%E4%BF%A1%E6%81%AF%E6%A2%AF%E5%BA%A6%E4%B8%8E%E5%86%B3%E7%AD%96%E5%BD%92%E5%9B%A0%E8%AF%84%E6%B5%8B%E7%9A%84%E5%AE%8C%E6%95%B4%E6%8B%86%E8%A7%A3/index.xml" rel="self" type="application/rss+xml"/></channel></rss>