OpenCompass 大模型评测
所属章节:类ChatGPT的模型评测对比;manifest 索引:6;原始行号:111
事实边界:实时页面核验时间为 2026-08-04。仅把当前可见页面直接支持的内容写为事实;无法访问、只显示站点外壳、超时或身份不明的信息均记为“待核实”。
项目简介
当前可确认名称:OpenCompass
提供大语言模型及多模态模型的一站式评测、配置、排行榜和评测集社区。
原始目录将它收录在“类ChatGPT的模型评测对比”章节。原始描述为:OpenCompass 上海人工智能实验室开发的一款开源、高效、全面的评测大模型体系及开放平台,提供完整开源可复现的评测框架,支持大语言模型、多模态模型各类模型的一站式评测。利用分布式技术,即使面对千亿参数模型也能在数小时内完成评测。基于多个不同维度的高认可度数据集开放多样化的评测方式,包括零样本评测、小样本评测和思维链评测,全方位量化模型各个维度能力。。目录描述反映收录时的理解,不自动等同于当前版本能力。
实时核验摘要
本次逐站访问 2 个原始链接,其中 2 个取得可确认页面证据,0 个跳过或报错。正式名称按页面显示记为“OpenCompass”。
- 可确认页面:2
- 跳过或错误页面:0
- 页面类型:代码仓库或文件页、官网或专题页面
- 核验时间:2026-08-04T10:15:54.423Z
项目特色
代码框架、公开榜单和评测集社区形成闭环,既可本地复现,也可查看多维公开结果。
该特色只依据本次可访问页面提炼,不把 Star 数、历史宣传语或第三方目录评价直接当作性能结论。
核心功能
提供大语言模型及多模态模型的一站式评测、配置、排行榜和评测集社区。
对于模型效果、速度、成本、稳定性与安全性的判断,仍需在目标版本、硬件和数据条件下单独测试;本文没有复现实验。
技术栈与资料范围
开源 Python 评测框架,仓库称覆盖 100+ 数据集;官网展示语言、推理、知识、数学、代码、指令跟随、智能体等维度。
数据规模、模型参数、上下文长度或基准成绩只有在当前页面明确展示时才可引用;没有页面证据的数字均为待核实。代码仓库许可证也不当然覆盖模型权重、训练数据和外部服务。
适用场景
适合作为“类ChatGPT的模型评测对比”方向的调研入口,用于阅读方法、比较工具、复现实验或构建候选方案。实际采用前应先区分它是软件、模型、数据集、论文、榜单还是资料清单,再确定验证指标。
生产使用需额外检查隐私、合规、上游模型条款、数据授权、资源消耗和故障降级。历史文章中的模型、价格与服务名称可能已经变化。
安装或使用入口
官方仓库提供 Installation 与 Evaluation 文档,官网提供快速上手入口。
- github.com
https://github.com/internLM/OpenCompass/ - opencompass.org.cn
https://opencompass.org.cn/
任何需要账号、API 密钥、模型权重或大规模算力的步骤,都应以当前官方说明为准。本文不生成页面未明确给出的凭据、参数或下载地址。
实践建议
- 先保存页面版本、提交号或论文版本,再记录实验环境。
- 从最小示例开始,确认依赖、输入输出和许可证边界。
- 对模型或榜单类项目固定数据集、提示模板、随机性与评价标准。
- 对资料清单逐条回到原论文或官方仓库,不把二手摘要当作最终依据。
- 若入口失效,记录日期与错误,不根据项目名猜测迁移位置。
优势与限制
优势:本条目至少保留了明确的主题、原始入口和可追踪的核验记录;可访问页面还提供了与项目定位直接相关的证据。
限制:页面内容会变化,本次访问没有验证运行结果、性能数字、价格、服务可用性或全部上游依赖。对 PDF、图片和动态在线文档,浏览器可见信息可能少于原文件全文。
维护状态、版本与许可证
维护状态:仓库显示 0.4.0 配置结构变更,并持续列出 2025—2026 的评测支持更新。
版本或更新时间:待核实。许可证:Apache-2.0。
若仓库同时包含代码、模型和数据,必须分别核对 LICENSE、模型卡、DATA_LICENSE 与上游底座条款;“开源”不等同于不受限制的商业使用。
原始链接与逐站访问结果
| 原始 URL | 状态 | HTTP | 页面标题 | 最终 URL | 证据摘要 | 跳过原因 |
|---|---|---|---|---|---|---|
| github.com | redirected | 待核实 | open-compass/opencompass: OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets. | https://github.com/open-compass/opencompass | OpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100+ datasets. - open-compass/opencompass | — |
| opencompass.org.cn | redirected | 待核实 | OpenCompass司南 | https://opencompass.org.cn/home | OpenCompass面向大模型的开源方和使用者, 提供开源、高效、全面的大模型评测开放平台。网站包含大模型评测榜单,评测集社区,文档等专区。榜单专区包含大语言模型以及多模态大模型榜单,提供多能力维度的评分参考。评测集社区致力于打造创新性的基准测试资源专区,提供丰富的评测集信息。 | — |
核验清单
- slug 保持为
opencompass。 - 保留 2 个原始链接并逐站记录。
- 正式名称、页面类型、功能和资料范围均按页面证据或“待核实”处理。
- 安装入口没有脱离原始页面补写。
- 维护状态、版本、许可证和项目特色均声明证据边界。
- 文章规范地址:/articles/opencompass-polished-guide


