中文大模型评测工具&排行榜

所属章节:类ChatGPT的模型评测对比;manifest 索引:5;原始行号:110

事实边界:实时页面核验时间为 2026-08-04。仅把当前可见页面直接支持的内容写为事实;无法访问、只显示站点外壳、超时或身份不明的信息均记为“待核实”。

项目简介

当前可确认名称:C-Eval

面向基础模型的中文知识与推理评测套件,提供榜单、验证集评测与评测代码。

原始目录将它收录在“类ChatGPT的模型评测对比”章节。原始描述为:C-Eval是一个全面的中文评估套件,适用于基础模型。它包含13948个多项选择题,涵盖52个不同的学科和四个难度级别,具体如下所示。请访问我们的网站或查阅我们的论文获取更多详细信息。。目录描述反映收录时的理解,不自动等同于当前版本能力。

实时核验摘要

本次逐站访问 2 个原始链接,其中 2 个取得可确认页面证据,0 个跳过或报错。正式名称按页面显示记为“C-Eval”。

  • 可确认页面:2
  • 跳过或错误页面:0
  • 页面类型:代码仓库或文件页、论文摘要或论文 PDF
  • 核验时间:2026-08-04T10:15:47.497Z

项目特色

中文本土学科覆盖与分层难度设计构成其主要特色,且代码许可和数据许可被明确拆分。

该特色只依据本次可访问页面提炼,不把 Star 数、历史宣传语或第三方目录评价直接当作性能结论。

核心功能

面向基础模型的中文知识与推理评测套件,提供榜单、验证集评测与评测代码。

对于模型效果、速度、成本、稳定性与安全性的判断,仍需在目标版本、硬件和数据条件下单独测试;本文没有复现实验。

技术栈与资料范围

13,948 道多项选择题、52 个学科、四个难度层级,并含强调数学、物理、化学推理的 C-Eval Hard。

数据规模、模型参数、上下文长度或基准成绩只有在当前页面明确展示时才可引用;没有页面证据的数字均为待核实。代码仓库许可证也不当然覆盖模型权重、训练数据和外部服务。

适用场景

适合作为“类ChatGPT的模型评测对比”方向的调研入口,用于阅读方法、比较工具、复现实验或构建候选方案。实际采用前应先区分它是软件、模型、数据集、论文、榜单还是资料清单,再确定验证指标。

生产使用需额外检查隐私、合规、上游模型条款、数据授权、资源消耗和故障降级。历史文章中的模型、价格与服务名称可能已经变化。

安装或使用入口

官方仓库提供 Data 与 How to Evaluate on C-Eval 章节;论文给出方法和实验背景。

任何需要账号、API 密钥、模型权重或大规模算力的步骤,都应以当前官方说明为准。本文不生成页面未明确给出的凭据、参数或下载地址。

实践建议

  1. 先保存页面版本、提交号或论文版本,再记录实验环境。
  2. 从最小示例开始,确认依赖、输入输出和许可证边界。
  3. 对模型或榜单类项目固定数据集、提示模板、随机性与评价标准。
  4. 对资料清单逐条回到原论文或官方仓库,不把二手摘要当作最终依据。
  5. 若入口失效,记录日期与错误,不根据项目名猜测迁移位置。

优势与限制

优势:本条目至少保留了明确的主题、原始入口和可追踪的核验记录;可访问页面还提供了与项目定位直接相关的证据。

限制:页面内容会变化,本次访问没有验证运行结果、性能数字、价格、服务可用性或全部上游依赖。对 PDF、图片和动态在线文档,浏览器可见信息可能少于原文件全文。

维护状态、版本与许可证

维护状态:仓库公告显示 2025-07-27 已向社区发布完整测试集;论文当前为 v3(2023-11-06)。

版本或更新时间:待核实。许可证:代码 MIT;仓库另有 LICENSE-DATA,数据许可需单独核对。

若仓库同时包含代码、模型和数据,必须分别核对 LICENSE、模型卡、DATA_LICENSE 与上游底座条款;“开源”不等同于不受限制的商业使用。

原始链接与逐站访问结果

原始 URL状态HTTP页面标题最终 URL证据摘要跳过原因
github.comredirected待核实hkust-nlp/ceval: Official github repo for C-Eval, a Chinese evaluation suite for foundation models [NeurIPS 2023]https://github.com/hkust-nlp/cevalOfficial github repo for C-Eval, a Chinese evaluation suite for foundation models [NeurIPS 2023] - hkust-nlp/ceval
arxiv.orgverified待核实[2305.08322] C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Modelshttps://arxiv.org/abs/2305.08322New NLP benchmarks are urgently needed to align with the rapid development of large language models (LLMs). We present C-Eval, the first comprehensive Chinese evaluation suite designed to assess advanced knowledge and reasoning abilities of foundation models in a Chinese context. C-Eval comprises multiple-choice questions across four difficulty levels: middl…

核验清单

  1. slug 保持为 and
  2. 保留 2 个原始链接并逐站记录。
  3. 正式名称、页面类型、功能和资料范围均按页面证据或“待核实”处理。
  4. 安装入口没有脱离原始页面补写。
  5. 维护状态、版本、许可证和项目特色均声明证据边界。
  6. 文章规范地址:/articles/and-polished-guide