HLE评测基准:大模型排名与测试结果

HLE评测基准:大模型排名与测试结果

HLE近年来,大语言模型(LLM)的能力飞速提升,但评测基准的发展却显得滞后。以广泛使用的MMLU(大规模多任务语言理解)为例,GPT-4、Claude等前沿模型已能在其90%以上的问题上取得高分。这种“评测饱和”现象导致研究者难以精准衡量模型在尖端知识领域的真实能力。为此,Safety for AI和Scale AI的研究人员推出了Humanity’s Last Exam大模型评测基准。这是一个全新的评测基准,旨在成为大模型“闭卷学术评测的终极考验”。

更新于 2026年7月18日·7,068 次浏览

相关推荐

国风·周南·芣苡
365赢了不让提款

国风·周南·芣苡

📅 07-17 👁️ 6801
笑林广记-贪吝部·大眼
365赢了不让提款

笑林广记-贪吝部·大眼

📅 06-24 👁️ 3029
流量卡代理渠道如何选择?有哪些优质平台推荐?
365wm完美体育

流量卡代理渠道如何选择?有哪些优质平台推荐?

📅 12-01 👁️ 4110