主流LLM 大模型排行榜介绍

2026-08-01 07:09:17

还在被各种“最强大模型”刷屏到眼花缭乱吗? DeepSeek、GPT-5、Claude 4.5、Grok 4、Gemini 2.5、Qwen3……每个月都有新王者登基,但不同榜单却经常“打得头破血流”: 同一个模型,在LMArena可能是神,在OpenRouter却垫底;在LiveBench能碾压一切,到了实际生产环境却被一个Flash版“弟弟”吊打。

为什么会出现这么大的差异? 因为每个榜单都在回答不同的问题:

用户觉得哪个最好用?

开发者真金白银投给谁?

谁在面对全新问题时最聪明?

谁又快又便宜又稳定?

2025年,单看一个榜单已经不够了。 今天这篇干货,我把目前最主流、最具参考价值的排行榜全部拆解清楚(LMArena、LiveBench、OpenRouter、Artificial Analysis等),告诉你它们分别在测什么、该信谁、该怎么结合看,帮你一次性搞懂当下大模型的真实座次!

LMArena Leaderboard

大模型竞技场LMArena Leaderboard 是一个由伯克利大学团队发起的全球大型语言模型公开评测平台,采用类似国际象棋Elo系统的用户盲测机制实时排名。

官网:https://lmarena.ai/leaderboard/

最大的特色就是用真实人类的偏好取代人工设计的基准,让排行更动态、贴近用户真实感受,已成为业界公认的最权威“民意”LLM 排行榜之一。

用户随机看到两个匿名模型对同一提示的回答,进行盲测投票(选更好、更喜欢或平局),所有投票数据实时聚合,形成排行榜。

不止一个总榜,还细分众多 Arena:

文本对话(主榜)

编程(Coding、WebDev Arena)

多模态(Vision)

文生图(Text-to-Image)

图像编辑(Image Edit)

搜索(Search)

视频生成(Text-to-Video、Image-to-Video)

助手(Copilot)

例如在WebDev编程领域,Claude的模型还是评分最高的,另外也看到国内的GLM-4.6、Qwen3-Coder、Minimax-M2位列5、6、7名。

LiveBench Leaderboard

LiveBench Leaderboard是2024年6月推出的一个专为解决“基准污染”(benchmark contamination)问题而设计的自动化、客观、每月更新的LLM评测榜单。它被誉为“最干净、最难、最公平的学术基准之一”

官网:https://livebench.ai/

LiveBench 是目前最能反映模型“真实智能水平”而非“记忆力”或“训练数据污染”的榜单,尤其适合判断一个模型在面对真正新问题时的泛化能力。2025年它与 LMArena 并列成为两大最受关注的“硬实力”榜单。

特色:

所有问题每月从最新来源生成:最近发布的数学竞赛、arXiv论文、新闻事件、公开数据集等。

问题发布后至少1个月才公开答案,确保新模型不可能在训练中见过这些题。

所有答案都有可验证的ground truth(正确答案),完全自动化评分,不依赖人类主观判断。

避免了LMArena那种主观偏见,也避免了HF Leaderboard后期被训练数据污染的问题。

2025年已扩展到更多子领域,并推出了姊妹榜单(如LiveCodeBench、LiveSWEBench等)

LiveCodeBench

LiveCodeBench 是一个用于评估 AI 编程能力的基准

LiveSWEBench

LiveSWEBench 是一个用于评估 AI 代理应用软件工程能力的基准。

OpenRouter LLM Rankings

OpenRouter Leaderboard 是基于真实开发者/应用通过OpenRouter API的实际使用量(主要是tokens消耗量或requests数量)来排名。

官网:https://openrouter.ai/rankings

排名依据:真实市场使用量(Market Share)

核心指标是通过OpenRouter路由的tokens数量(输入+输出tokens)或completion requests数量。

高度体现“性价比”而非纯能力

便宜、快、好用的模型容易霸榜(例如最近的Minimax的M2就冲到第四名,ChatGPT系列就因为费用高而经常被挤下排名)。

Artificial Analysis Leaderboard

Artificial Analysis Leaderboard 2025年最全面、最实用的“工程师向” LLM 评测平台之一,由独立第三方团队 Artificial Analysis 维护。它不像 LMArena 那样靠人类投票,也不像 LiveBench 那样只测纯能力,而是把质量(Quality)、速度(Speed)、价格(Price)、延迟(Latency)、上下文长度 等所有开发者最关心的维度统一测评并可视化,帮助你“一站式”决定用哪个模型最划算。

官网:https://artificialanalysis.ai/

多维度统一标准化评测

Quality Index:综合多个学术基准(MMLU-Pro、GPQA Diamond、MATH、GSM8K、HumanEval、Arena Elo 等)的加权平均分,基本和 LMArena 顶级模型同步。

Speed:输出速度(tokens/s)和首 token 延迟(TTFT),在统一硬件/云环境实测。

Price:每百万 tokens 的实际 API 价格(输入+输出)。

其他:上下文窗口长度、工具调用能力、多模态支持等。

所有指标都标准化成可直接比较的分数或图表。

Hugging Face Open LLM Leaderboard

Hugging Face Open LLM Leaderboard是目前开源大语言模型(Open-source LLM)领域最经典、最权威的自动化基准测试排行榜。它专注于纯开源、可复现的模型评估

官网:https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard#

由于数据污染等原因,现在使用较少。截至2025年11月,Space 仍可访问历史数据,但新模型提交已大幅减少,不再是实时最活跃的榜单。许多人已转向 LMArena、LiveBench等替代品。

特色如下:

严格专注开源模型

不依赖人类投票,而是用固定数据集计算准确率。

强大过滤与展示功能

OpenCompass

目前国内相关的大模型竞技场已经几乎绝迹了,还剩一个上海人工智能实验室的司南测评。找国内模型大家可以参考一下。

官网:https://rank.opencompass.org.cn/home

传统静态基准测试

在 LMArena、LiveBench 这类新榜单出现之前,学术界和工业界主要依赖静态基准测试(Benchmark),靠固定数据集 + 自动化准确率的方式评估LLM。这种方式也被称为“经典基准测试”(Classic Benchmarks)。下面是几大类最有代表性的传统方法:

传统学术评估 = “给模型做标准化高考卷子”,曾经(2020–2023)是绝对主流,推动了GPT-3到LLaMA的飞速进步;但2024年后 LiveBench(每月新题)、LMArena(人类偏好)、SWE-Bench(真实任务)等新一代方法出现,丰富了大模型评测的方法。也推动静态评估方法的更新(比如:2024年5月15日,TIGER-Lab团队推出了MMLU-Pro,堪称地狱版难度)。

总结

下面分维度对比了主流的几个排行榜给大家参考:

社区里大家通常会同时看这5个,形成最全面的判断:

LMArena → 用户真实偏好(民意)

LiveBench → 最干净的客观推理能力

Artificial Analysis → 速度+价格+质量一站式对比

OpenRouter → 开发者真金白银投票(市场份额)

SWE-Bench → Agent和工具调用真实能力

如何系统的去学习大模型LLM ?

大模型时代,火爆出圈的LLM大模型让程序员们开始重新评估自己的本领。 “AI会取代那些行业?”“谁的饭碗又将不保了?”等问题热议不断。

事实上,抢你饭碗的不是AI,而是会利用AI的人。

继科大讯飞、阿里、华为等巨头公司发布AI产品后,很多中小企业也陆续进场!超高年薪,挖掘AI大模型人才! 如今大厂老板们,也更倾向于会AI的人,普通程序员,还有应对的机会吗?

与其焦虑……

不如成为「掌握AI工具的技术人」,毕竟AI时代,谁先尝试,谁就能占得先机!

但是LLM相关的内容很多,现在网上的老课程老教材关于LLM又太少。所以现在小白入门就只能靠自学,学习成本和门槛很高。

针对所有自学遇到困难的同学们,我帮大家系统梳理大模型学习脉络,将这份 LLM大模型资料 分享出来:包括LLM大模型书籍、640套大模型行业报告、LLM大模型学习视频、LLM大模型学习路线、开源大模型学习教程等

一、LLM大模型经典书籍

AI大模型已经成为了当今科技领域的一大热点,那以下这些大模型书籍就是非常不错的学习资源。

二、640套LLM大模型报告合集

这套包含640份报告的合集,涵盖了大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。(几乎涵盖所有行业)

三、LLM大模型系列视频教程

四、LLM大模型开源教程(LLaLA/Meta/chatglm/chatgpt)

这份 LLM大模型资料 包括LLM大模型书籍、640套大模型行业报告、LLM大模型学习视频、LLM大模型学习路线、开源大模型学习教程等

😝有需要的小伙伴,可以 下方小卡片领取🆓↓↓↓

毛阿敏最新献声,演唱感人佳作《为了你,我愿意》,抒发了广大援疆工作者的心声,系援疆电影《阿克达拉》主题曲
蒸南瓜别只切块!多做这一步,15分钟软糯香甜,口感翻倍