中文科学文献数据集(CSL)

所属章节:预训练语言模型&大模型|manifest 索引:280|原始行号:453

当前核验名称:Chinese Scientific Literature Dataset (CSL)|页面类型:中文科学文献数据集与基准

项目简介

该条目在原始目录中的名称为“中文科学文献数据集(CSL)”,slug 为 csl,归入“预训练语言模型&大模型”。实时核验显示,当前最可信入口对应“Chinese Scientific Literature Dataset (CSL)”,资料形态是中文科学文献数据集与基准。以下新增事实以页面当前可见 README、仓库状态或元信息为依据。

当前可确认的核心边界是:包含 396,209 篇 2010—2020 中文核心期刊论文元信息,字段有标题、摘要、关键词、学科和门类;提供摘要、关键词生成和分类任务。这一定义不自动证明它适合生产、兼容最新依赖,或拥有页面未写明的商用权利。

实时核验摘要

  • 核验时间:2026-08-04T10:19:02.353Z
  • 访问状态:verified
  • 正式名称:Chinese Scientific Literature Dataset (CSL)
  • 页面类型:中文科学文献数据集与基准
  • 版本或更新时间:COLING 2022;无 tags
  • 维护状态:仓库未归档;数据论文发表于 COLING 2022
  • 许可证:待核实(README 有 License 章节入口但本次摘要未确认具体条款)

redirected 表示原 URL 已迁移到当前官方入口;skippederror 只记录失败证据,不补写无法访问的页面内容。

项目特色

同时提供大规模元数据和共享划分的四类 text2text 基准,便于多任务对比。这项结论来自可访问页面的明确说明或文件结构;没有证据时已直接写明“暂未从可访问资料确认特色”。

核心功能

  • 包含 396,209 篇 2010—2020 中文核心期刊论文元信息,字段有标题、摘要、关键词、学科和门类
  • 提供摘要、关键词生成和分类任务

建议把功能拆成最小可验证任务:确认输入格式,运行一条官方示例,检查输出结构,再决定是否进入完整训练、批处理或部署。历史研究仓库还要把“代码可读”与“当前环境可复现”分开判断。

技术栈与资料范围

13 个门类、67 个学科;基准抽样 10,000 条并按 8:1:1 划分;text2text 格式;基线含 T5/BART/Pegasus。

这里只覆盖页面明确展示的语言、框架、数据规模或文件格式。没有出现的硬件下限、吞吐、参数量、训练成本、价格和安全审计结论均为待核实。外部模型或数据的许可也应独立审查。

适用场景

  • 科学文献预训练
  • 标题生成
  • 关键词生成
  • 门类/学科分类

这些场景是已确认功能的直接用途归纳,不是效果承诺。应先用小规模代表性样例建立人工可检查的基线,再评估是否采用或迁移到现代替代方案。

安装或使用入口

当前可确认入口:git clone CSL 与 UER-py,复制 benchmark 和 run_text2text_csl.py 后按 README 微调

命令只有在页面明确出现时才保留。执行前应使用隔离环境、锁定依赖版本、记录下载校验值,并检查 issue、归档提示和数据条款。若入口失效,则不能猜测包名安装。

实践建议

  1. 先核对最终域名、仓库所有者和页面标题,避免使用同名镜像。
  2. 将最小示例保存为可重复脚本,并记录环境、输入与实际输出。
  3. 归档或依赖老旧的项目优先放入容器或一次性环境复现。
  4. 数据资源抽查字段、编码、重复、噪声、敏感信息和授权;模型资源核验权重来源。
  5. 历史性能只视为仓库原实验,不外推到当前硬件和数据。

优势与限制

优势:同时提供大规模元数据和共享划分的四类 text2text 基准,便于多任务对比。

限制:数据授权和原始来源使用条件需先确认;年份止于 2020,不能代表最新科研分布。此外,未归档不等于持续维护,星标和提交数也不能替代兼容性、安全性与许可审计。

维护状态、版本与许可证

  • 维护状态:仓库未归档;数据论文发表于 COLING 2022
  • 版本/更新时间:COLING 2022;无 tags
  • 许可证:待核实(README 有 License 章节入口但本次摘要未确认具体条款)
  • 资料可信度:官方仓库、官方页面或其明确重定向是首要证据;失效、拦截和无法确认身份的页面不作为事实来源。

“待核实”表示本次页面没有足够证据,不代表默认允许商用或默认停止维护。实际采用前应阅读 LICENSE、release/tag、提交历史与外部数据条款。

原始链接与逐站访问结果

以下 URL 按 assignment 原样保留:

  1. 站点 1:https://github.com/ydli-ai/CSL

    • status:verified
    • httpStatus:200
    • finalUrl:https://github.com/ydli-ai/CSL
    • pageTitle:ydli-ai/CSL
    • checkedAt:
    • evidenceSummary:页面可确认正式名称“Chinese Scientific Literature Dataset (CSL)”、页面类型、核心功能、技术或资料范围、使用入口及维护/许可线索。
    • skipReason:无

核验清单

  • 原项目名称、slug、章节、manifest 索引和原始行号已保留。
  • 原始链接共 1 个,sourceChecks 共 1 条。
  • 名称、页面类型、功能、技术/数据范围、入口、维护、版本和许可证均已写明或标记待核实。
  • 项目特色具有页面证据,或明确说明暂无可访问证据。
  • 未把历史性能、旧标题或重定向前范围误写成当前结论。
  • 本文含 12 个 h2,HTML 可直接渲染。