OpenCompass 大模型评测

所属章节:类ChatGPT的模型评测对比;manifest 索引:6;原始行号:111

事实边界:实时页面核验时间为 2026-08-04。仅把当前可见页面直接支持的内容写为事实;无法访问、只显示站点外壳、超时或身份不明的信息均记为“待核实”。

项目简介

当前可确认名称:OpenCompass

提供大语言模型及多模态模型的一站式评测、配置、排行榜和评测集社区。

原始目录将它收录在“类ChatGPT的模型评测对比”章节。原始描述为:OpenCompass 上海人工智能实验室开发的一款开源、高效、全面的评测大模型体系及开放平台,提供完整开源可复现的评测框架,支持大语言模型、多模态模型各类模型的一站式评测。利用分布式技术,即使面对千亿参数模型也能在数小时内完成评测。基于多个不同维度的高认可度数据集开放多样化的评测方式,包括零样本评测、小样本评测和思维链评测,全方位量化模型各个维度能力。。目录描述反映收录时的理解,不自动等同于当前版本能力。

实时核验摘要

本次逐站访问 2 个原始链接,其中 2 个取得可确认页面证据,0 个跳过或报错。正式名称按页面显示记为“OpenCompass”。

  • 可确认页面:2
  • 跳过或错误页面:0
  • 页面类型:代码仓库或文件页、官网或专题页面
  • 核验时间:2026-08-04T10:15:54.423Z

项目特色

代码框架、公开榜单和评测集社区形成闭环,既可本地复现,也可查看多维公开结果。

该特色只依据本次可访问页面提炼,不把 Star 数、历史宣传语或第三方目录评价直接当作性能结论。

核心功能

提供大语言模型及多模态模型的一站式评测、配置、排行榜和评测集社区。

对于模型效果、速度、成本、稳定性与安全性的判断,仍需在目标版本、硬件和数据条件下单独测试;本文没有复现实验。

技术栈与资料范围

开源 Python 评测框架,仓库称覆盖 100+ 数据集;官网展示语言、推理、知识、数学、代码、指令跟随、智能体等维度。

数据规模、模型参数、上下文长度或基准成绩只有在当前页面明确展示时才可引用;没有页面证据的数字均为待核实。代码仓库许可证也不当然覆盖模型权重、训练数据和外部服务。

适用场景

适合作为“类ChatGPT的模型评测对比”方向的调研入口,用于阅读方法、比较工具、复现实验或构建候选方案。实际采用前应先区分它是软件、模型、数据集、论文、榜单还是资料清单,再确定验证指标。

生产使用需额外检查隐私、合规、上游模型条款、数据授权、资源消耗和故障降级。历史文章中的模型、价格与服务名称可能已经变化。

安装或使用入口

官方仓库提供 Installation 与 Evaluation 文档,官网提供快速上手入口。

任何需要账号、API 密钥、模型权重或大规模算力的步骤,都应以当前官方说明为准。本文不生成页面未明确给出的凭据、参数或下载地址。

实践建议

  1. 先保存页面版本、提交号或论文版本,再记录实验环境。
  2. 从最小示例开始,确认依赖、输入输出和许可证边界。
  3. 对模型或榜单类项目固定数据集、提示模板、随机性与评价标准。
  4. 对资料清单逐条回到原论文或官方仓库,不把二手摘要当作最终依据。
  5. 若入口失效,记录日期与错误,不根据项目名猜测迁移位置。

优势与限制

优势:本条目至少保留了明确的主题、原始入口和可追踪的核验记录;可访问页面还提供了与项目定位直接相关的证据。

限制:页面内容会变化,本次访问没有验证运行结果、性能数字、价格、服务可用性或全部上游依赖。对 PDF、图片和动态在线文档,浏览器可见信息可能少于原文件全文。

维护状态、版本与许可证

维护状态:仓库显示 0.4.0 配置结构变更,并持续列出 2025—2026 的评测支持更新。

版本或更新时间:待核实。许可证:Apache-2.0。

若仓库同时包含代码、模型和数据,必须分别核对 LICENSE、模型卡、DATA_LICENSE 与上游底座条款;“开源”不等同于不受限制的商业使用。

原始链接与逐站访问结果

原始 URL状态HTTP页面标题最终 URL证据摘要跳过原因
github.comredirected待核实open-compass/opencompass: OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets.https://github.com/open-compass/opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets. - open-compass/opencompass
opencompass.org.cnredirected待核实OpenCompass司南https://opencompass.org.cn/homeOpenCompass面向大模型的开源方和使用者, 提供开源、高效、全面的大模型评测开放平台。网站包含大模型评测榜单,评测集社区,文档等专区。榜单专区包含大语言模型以及多模态大模型榜单,提供多能力维度的评分参考。评测集社区致力于打造创新性的基准测试资源专区,提供丰富的评测集信息。

核验清单

  1. slug 保持为 opencompass
  2. 保留 2 个原始链接并逐站记录。
  3. 正式名称、页面类型、功能和资料范围均按页面证据或“待核实”处理。
  4. 安装入口没有脱离原始页面补写。
  5. 维护状态、版本、许可证和项目特色均声明证据边界。
  6. 文章规范地址:/articles/opencompass-polished-guide