开源预训练语言模型合集
所属章节:预训练语言模型&大模型|manifest 索引:271|原始行号:444
当前核验名称:Open Language Pre-trained Model Zoo|页面类型:中文预训练语言模型合集
项目简介
该条目在原始目录中的名称为“开源预训练语言模型合集”,slug 为 github-com-zhuiyitechnology-pretrained-models--pretrained-language-models,归入“预训练语言模型&大模型”。实时核验显示,当前最可信入口对应“Open Language Pre-trained Model Zoo”,资料形态是中文预训练语言模型合集。以下新增事实以页面当前可见 README、仓库状态或元信息为依据。
当前可确认的核心边界是:发布 RoBERTa、SimBERT、WoBERT、T5 PEGASUS 等模型的配置、下载入口和多任务评测。这一定义不自动证明它适合生产、兼容最新依赖,或拥有页面未写明的商用权利。
实时核验摘要
- 核验时间:2026-08-04T10:18:25.071Z
- 访问状态:
verified - 正式名称:Open Language Pre-trained Model Zoo
- 页面类型:中文预训练语言模型合集
- 版本或更新时间:无统一版本号
- 维护状态:仓库未归档但无 tags;外部下载地址需逐个验证
- 许可证:Apache-2.0
redirected 表示原 URL 已迁移到当前官方入口;skipped 或 error 只记录失败证据,不补写无法访问的页面内容。
项目特色
同一表格并列数据来源、词表和模型大小,还附情感分类、IFLYTEK、信息抽取、问答等对照。这项结论来自可访问页面的明确说明或文件结构;没有证据时已直接写明“暂未从可访问资料确认特色”。
核心功能
- 发布 RoBERTa、SimBERT、WoBERT、T5 PEGASUS 等模型的配置、下载入口和多任务评测
建议把功能拆成最小可验证任务:确认输入格式,运行一条官方示例,检查输出结构,再决定是否进入完整训练、批处理或部署。历史研究仓库还要把“代码可读”与“当前环境可复现”分开判断。
技术栈与资料范围
模型数据涵盖百科、新闻、百度知道等;模型大小从 tiny 到 base/生成模型;示例基于 bert4keras。
这里只覆盖页面明确展示的语言、框架、数据规模或文件格式。没有出现的硬件下限、吞吐、参数量、训练成本、价格和安全审计结论均为待核实。外部模型或数据的许可也应独立审查。
适用场景
- 中文模型选型
- 轻量模型实验
- 句向量和生成任务
这些场景是已确认功能的直接用途归纳,不是效果承诺。应先用小规模代表性样例建立人工可检查的基线,再评估是否采用或迁移到现代替代方案。
安装或使用入口
当前可确认入口:通过 README 的模型表下载,并用 examples 或相应项目加载
命令只有在页面明确出现时才保留。执行前应使用隔离环境、锁定依赖版本、记录下载校验值,并检查 issue、归档提示和数据条款。若入口失效,则不能猜测包名安装。
实践建议
- 先核对最终域名、仓库所有者和页面标题,避免使用同名镜像。
- 将最小示例保存为可重复脚本,并记录环境、输入与实际输出。
- 归档或依赖老旧的项目优先放入容器或一次性环境复现。
- 数据资源抽查字段、编码、重复、噪声、敏感信息和授权;模型资源核验权重来源。
- 历史性能只视为仓库原实验,不外推到当前硬件和数据。
优势与限制
优势:同一表格并列数据来源、词表和模型大小,还附情感分类、IFLYTEK、信息抽取、问答等对照。
限制:模型各自的数据、许可与下载可用性不同;历史评测环境不等于当前表现。此外,未归档不等于持续维护,星标和提交数也不能替代兼容性、安全性与许可审计。
维护状态、版本与许可证
- 维护状态:仓库未归档但无 tags;外部下载地址需逐个验证
- 版本/更新时间:无统一版本号
- 许可证:Apache-2.0
- 资料可信度:官方仓库、官方页面或其明确重定向是首要证据;失效、拦截和无法确认身份的页面不作为事实来源。
“待核实”表示本次页面没有足够证据,不代表默认允许商用或默认停止维护。实际采用前应阅读 LICENSE、release/tag、提交历史与外部数据条款。
原始链接与逐站访问结果
以下 URL 按 assignment 原样保留:
- https://github.com/ZhuiyiTechnology/pretrained-models
https://github.com/ZhuiyiTechnology/pretrained-models
站点 1:https://github.com/ZhuiyiTechnology/pretrained-models
- status:
verified - httpStatus:200
- finalUrl:
https://github.com/ZhuiyiTechnology/pretrained-models - pageTitle:ZhuiyiTechnology/pretrained-models
- checkedAt:
- evidenceSummary:页面可确认正式名称“Open Language Pre-trained Model Zoo”、页面类型、核心功能、技术或资料范围、使用入口及维护/许可线索。
- skipReason:无
- status:
核验清单
- 原项目名称、slug、章节、manifest 索引和原始行号已保留。
- 原始链接共 1 个,
sourceChecks共 1 条。 - 名称、页面类型、功能、技术/数据范围、入口、维护、版本和许可证均已写明或标记待核实。
- 项目特色具有页面证据,或明确说明暂无可访问证据。
- 未把历史性能、旧标题或重定向前范围误写成当前结论。
- 本文含 12 个
h2,HTML 可直接渲染。


