Top AI Repos — open-source AI, indexed and scored
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
| Date | Stars |
|---|---|
| 2026-07-31 | 6329 |
| 2026-08-02 | 6329 |
| 2026-08-04 | 6346 |
| 2026-08-06 | 6346 |
Today
— stars today
This week
— stars this week
This month
— stars this month
Momentum
5.0
growth rate 0.00%/day
# 非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新)
- ReLE (**R**eally R**e**liable **L**ive **E**valuation for LLM),原名CLiB
- 目前已囊括395个大模型,覆盖chatgpt、gpt-5.6、谷歌gemini-3.1-pro、Claude-5、grok-4.5、文心ERNIE-X1.1、ERNIE-5.1、qwen3.7-max、qwen3.7-plus、百川、讯飞星火、商汤senseChat等商用模型,
以及hy3、step3.7-flash、kimi-k3、ernie4.5、MiniMax-M3、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.2、MiMo-V2、LongCat、gemma4、mistral等开源大模型。
- 支持多维度能力评测,包括教育、医疗与心理健康、金融、法律与行政公务、推理与数学计算、语言与指令遵从、agent与工具调用等7个领域,以及细分的~300个维度(比如牙科、高中语文…)。详见我们的技术报告[ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs](https://www.arxiv.org/abs/2601.17399) 媒体报道(机器之心):[全球304个中文大模型实测:没有“全能王者”,ReLE凭70%降本方案破解评估困局](https://www.jiqizhixin.com/articles/2026-02-03)
- 不仅提供排行榜,也提供规模**超200万的大模型缺陷库**!方便广大社区研究分析、改进大模型。
- 为您的私有大模型提供免费评测服务,联系我们(非线智能 ReLE benchmark团队):[加微信](#联系我们非线智能-ReLE-benchmark团队)
# 目录
- [🔄最近更新](#最近更新)
- [⚓GitHub热门大模型评测项目](#GitHub热门大模型评测项目)
- [📝大模型基本信息](#大模型基本信息)
- [📊排行榜](#-排行榜)
- [0、多模态排行榜](#0多模态排行榜)
- [1、综合能力排行榜](#1综合能力排行榜)
- [1.1 推理类模型排行榜](#11推理类模型排行榜)
- [1.2 商用大模型排行榜(含开源模型的付费API)](#12商用大模型排行榜含开源模型的付费API)
- [1.3 开源大模型排行榜](#13开源大模型排行榜)
- [2、教育排行榜](#2教育排行榜)
- [2.1 小学学科](#21-小学学科) | [2.2 初中学科](#22-初中学科) | [2.3 中考TODO](#23-中考TODO)
- [2.4 高中学科](#24-高中学科) | [2.5 高考](#25-高考) | [2.6 高等教育TODO](#26-高等教育TODO)
- [2.7 考研TODO](#27-考研TODO) | [2.8 教师资格TODO](#28-教师资格TODO)
- [3、医疗与心理健康排行榜](#3医疗与心理健康排行榜)
- [3.1 医师](#31-医师) | [3.2 护理](#32-护理) | [3.3 药师](#33-药师)
- [3.4 医技](#34-医技) | [3.5 医学基础知识](#35-医学基础知识) | [3.6 医学考研](#36-医学考研)
- [3.7 心理健康](#37-心理健康)
- [4、金融排行榜](#4金融排行榜)
- [4.1 财务](#41-财务) | [4.2 银行](#42-银行) | [4.3 保险](#43-保险)
- [4.4 证券](#44-证券) | [4.5 其他金融资格考试](#45-其他金融资格考试) | [4.6 金融基础知识](#46-金融基础知识)
- [4.7 金融应用](#47-金融应用)
- [5、法律与行政公务排行榜](#5法律与行政公务排行榜)
- [5.1 律师资格考试](#51-律师资格考试)
- [5.2 公务员考试](#52-公务员考试)
- [6、推理与数学计算排行榜](#6推理与数学计算排行榜)
- [6.1 演绎推理](#61-演绎推理) | [6.2 常识推理](#62-常识推理) | [6.3 符号推理BBH](#63-符号推理BBH)
- [6.4 算术能力](#64-算术能力) | [6.5 表格问答](#65-表格问答) | [6.6 表格总结](#66-表格总结)
- [6.7 高中奥数](#67-高中奥数) | [6.8 初中奥数TODO](#68-初中奥数TODO) | [6.9 小学奥数](#69-小学奥数)
- [6.10 地图推理TODO](#610-地图推理TODO) | [6.11 空间推理TODO](#611-空间推理TODO) | [6.12 数独](#612-数独)
- [6.13 金额大小写转换TODO](#613-金额大小写转换TODO) | [6.14 日期计算TODO](#614-日期计算TODO)
- [7、语言与指令遵从排行榜](#7语言与指令遵从排行榜)
- [7.1 成语理解](#71-成语理解) | [7.2 情感分析](#72-情感分析) | [7.3 文本蕴含](#73-文本蕴含)
- [7.4 文本分类](#74-文本分类) | [7.5 信息抽取](#75-信息抽取) | [7.6 阅读理解](#76-阅读理解)
- [7.7 代词理解](#77-代词理解) | [7.8 诗词匹配](#78-诗词匹配) | [7.9 中文指令遵从](#79-中文指令遵从)
- [7.10 汉字字形](#710-汉字字形) | [7.11 汉语拼音TODO](#711-汉语拼音TODO) | [7.12 找错别字TODO](#712-找错别字TODO)
- [7.13 句子理解TODO](#713-句子理解TODO) | [7.14 标点符号TODO](#714-标点符号TODO) | [7.15 汉字繁简转换TODO](#715-汉字繁简转换TODO)
- [7.16 语种识别TODO](#716-语种识别TODO)
- [8、agent与工具调用排行榜](#8agent与工具调用排行榜)
- [8.1 TAU](#81-TAU)
- [8.2 BFCL-V3](#82-BFCL-V3)
- [9、coding排行榜](#9coding排行榜)
- [9.1 livecodebench](#91-livecodebench)
- [9.2 Terminal-Bench-2.0](#92-Terminal-Bench-20)
- [10、整合LMArena和AA分数](#10整合LMArena和AA分数)
- [🌐各项能力评分](#🌐各项能力评分)
- [为什么做榜单?](#为什么做榜单)
- [大模型选型及评测交流群](#大模型评测交流群)
- [Cite Us](#如何引用-ReLE-评测Cite-Us)
# 最近评测更新
- [2026/8/4] v5.10.17版本
- 新增大模型:qwen3.8-max
- 删除陈旧的模型:Baichuan4-Turbo、Llama-4-Scout-17B-16E-Instruct、GLM-4-9B-0414、
Qwen3-32B、Qwen3-14B、Qwen3-8B、Qwen3-4B、o4-mini、DeepSeek-R1-0528、ERNIE-4.5-Turbo-32K、
ERNIE-X1-Turbo-32K、claude-4-sonnet、claude-4-sonnet-thinking、gemini-2.5-flash、
gemini-2.5-pro、hunyuan-t1-20250711、qwen-turbo-2025-07-15、qwen3-235b-a22b-instruct-2507、qwen3-235b-a22b-thinking-2507、
Qwen3-4B-nothink、QweExcerpt of 63,858 characters
Read on GitHub479
10
Would you bet a product on this? Bounded 0–100 and slow moving.
matched fp:458c16ed9c1ea7f6, topic:agentic-ai, topic:llm-agent
matched fp:458c16ed9c1ea7f6, topic:llm-evaluation