文言文(古文)-现代文平行语料
所属章节:语料库|manifest 索引:202|原始行号:363
短篇章中包括了《论语》、《孟子》、《左传》等篇幅较短的古籍,已和《资治通鉴》合并
项目简介
本条目在原始目录中名为“文言文(古文)-现代文平行语料”。本次实时核验后,可访问来源显示其正式名称或仓库名为“Classical-Modern”,入口类型为GitHub 代码/数据仓库。古文原文按书籍和篇章组织,平行数据按 source.txt、target.txt、bitext.txt 分发。
本文只陈述核验时页面能够支持的事实。原始目录与当前页面不一致之处,以“原始记录”和“实时证据”分别呈现;没有在页面、README、仓库元数据或论文摘要中出现的信息均标为“待核实”。
实时核验摘要
- 正式名称:Classical-Modern
- 页面类型:GitHub 代码/数据仓库
- 本次共核验 1 个原始链接,其中可确认 1 个、未确认 0 个
- 核验时间:2026-08-04T10:26:05Z
访问状态中的 redirected 表示原始链接自动跳转,但最终页面仍能确认项目身份;error 或 skipped 不作为新增事实依据。HTTP 状态和最终地址均保留在逐站结果中,便于后续复查。
项目特色
有证据支持的特色:把经典古籍整理为句子级文言文—现代文平行语料,并同时保留原文、译文和 bitext 三种文件。
这一特色来自当前可访问页面的项目介绍、README 或论文摘要,并非根据项目名称推断。若要将其用于论文实验、生产数据或商业产品,还应继续核对数据来源、样本质量、许可范围与引用要求。
核心功能
- 古文原文按书籍和篇章组织,平行数据按 source.txt、target.txt、bitext.txt 分发。
- README 报告约 972,467 个对齐句,并保留原文相对顺序。
- 对齐流程结合归一化编辑距离与长度比;无译文或译文残缺的内容不会进入双语目录。
上述功能描述的证据强度取决于来源类型:官方仓库 README 和论文页面可支持项目定位,但目录列表、第三方镜像或仅有标题的页面不能替代完整技术文档。性能、准确率、价格、作者承诺与未展示的功能均为待核实。
技术栈与资料范围
- 主要技术/资料形态:文本数据与 Python 处理脚本。
- 覆盖《论语》《孟子》《左传》《资治通鉴》等古籍。
- 数据来自互联网,文本准确性、译文版权和自动对齐误差需审查。
- 原始目录保留的描述为:短篇章中包括了《论语》、《孟子》、《左传》等篇幅较短的古籍,已和《资治通鉴》合并。
技术语言来自仓库元数据时只代表代码占比信号,不等于完整依赖栈;“数据文件为主”或“资料索引为主”则说明该资源不宜按可安装软件理解。数据字段、切分、清洗、标注一致性、去重和覆盖偏差仍需结合仓库文件或论文正文审计。
适用场景
- 用于与“文言文(古文)-现代文平行语料”原始定位一致的数据调研、基线复现或资料索引。
- 在小规模样本上验证格式、编码、字段与任务匹配度,再决定是否纳入正式实验。
- 将当前页面作为入口,继续核对数据下载、论文引用、许可证和维护记录。
如果项目是数据列表或资源集合,应逐个核验其下游数据源;如果项目是模型或工具仓库,也不能仅凭仓库可克隆就认定模型文件、训练数据和运行环境仍然可用。
安装或使用入口
git clone https://github.com/NiuTrans/Classical-Modern.git
克隆仓库只是取得资料的入口,不等同于完成安装。执行任何命令前应先检查当前分支、依赖文件、下载脚本和数据条款。对于论文 PDF 或失效链接,本次未确认可执行安装流程,安装方式为待核实。
实践建议
- 先保存原始文件校验值,并记录下载日期、最终 URL 与版本线索,避免后续页面变化导致实验不可复现。
- 抽样检查编码、空值、重复项、异常长度和标签分布;涉及文本语料时还要检查隐私、冒犯内容与版权风险。
- 先运行最小样例,再扩大数据规模; README 中的历史命令可能依赖旧版框架或已经迁移的下载地址。
- 发表结果或上线前,重新核对许可证、引用格式和数据再分发限制。
优势与限制
优势:该条目提供了明确的项目入口;本次可访问页面还给出了“把经典古籍整理为句子级文言文—现代文平行语料,并同时保留原文、译文和 bitext 三种文件。”这一可追溯特色,有助于判断是否值得进一步下载和审计。
限制:目录描述可能早于当前页面,仓库可访问也不代表依赖仍兼容。当前未确认的版本、完整数据统计、基准成绩、硬件要求、商业授权、隐私合规与长期维护承诺均不能默认成立。
维护状态、版本与许可证
- 维护状态:待核实。
- 最近代码推送:待核实。
- 页面/仓库更新时间:待核实。
- 正式版本:待核实;未把分支名或单次提交自动视为稳定版本。
- 许可证:待核实。数据许可与代码许可可能不同,使用前应检查当前 LICENSE、README 和数据来源条款。
原始链接与逐站访问结果
| URL | 状态 | HTTP | 页面标题 | 最终地址 | 证据摘要/原因 |
|---|---|---|---|---|---|
原始链接https://github.com/NiuTrans/Classical-Modern | verified | 200 | GitHub - NiuTrans/Classical-Modern: 非常全的文言文(古文)-现代文平行语料 · GitHub | https://github.com/NiuTrans/Classical-Modern | Classical-Modern;非常全的文言文(古文)-现代文平行语料. Contribute to NiuTrans/Classical-Modern development by creating an account on GitHub.;文言文(古文)- 现代文平行语料 一、语料简介 这是一个非常全的文言文(古文)- 现代文平行语料,基本涵盖了大部分经典古籍著作。从文学角度出发,本项目将所有古文原文整理至文件夹 `古文原文` 中,并对每本古籍,按篇章/章节进行划分与展示,正文部分存于各章节下的 `text.txt` 中,例如 `论语/学而篇/text.txt` ,`孟子/梁惠王章句上/第一节/text.txt` 。对于平行数据,本项目整理至文件夹 `双语数据` 中,这些双语数据是以句子级别为单位进行划分,本项目提供了原文、译文、双语三种数据格式,例如:`论语/学而篇/source.txt` 、 `论语/学而篇/target.txt` 、 `论语/学而篇/bitext.txt` 。注:所有数据均按行保留了古文原文的相对顺序,即数据非打乱。;本语料数据来源于互联网 1 ,所爬取到的原始数据是篇章级对齐的双语数据,经过脚本进行分句、对齐,处理成了句子级别对齐的双语(平行)数据,共计 *972467* 句。核心对齐思路采用归一化编辑距离算法与长度比指标。 |
项目名:文言文(古文)-现代文平行语料
原始描述:短篇章中包括了《论语》、《孟子》、《左传》等篇幅较短的古籍,已和《资治通鉴》合并
章节:语料库
行号:363
核验清单
- slug 保持为
github-com-niutrans-classical-modern,未改名、未合并项目。 - 全部 1 个原始链接已保留,并分别生成 sourceChecks 记录。
- 页面类型、正式名称、功能、技术范围、入口、维护线索、更新时间和许可证均按当前证据填写;缺失项标为“待核实”。
- 文章包含项目特色、优势与限制以及逐站访问结果,且不使用失效页面推断新增事实。
规范链接:/articles/github-com-niutrans-classical-modern-polished-guide


