古诗词库

所属章节:语料库|manifest 索引:170|原始行号:331

项目简介

本条目在原始目录中名为“古诗词库”。本次实时核验后,可访问来源显示其正式名称或仓库名为“AncientPoetry / chinese-poetry”,入口类型为GitHub 代码/数据仓库。首个仓库仅明确说明其为自行抓取的古诗词语料。

本文只陈述核验时页面能够支持的事实。原始目录与当前页面不一致之处,以“原始记录”和“实时证据”分别呈现;没有在页面、README、仓库元数据或论文摘要中出现的信息均标为“待核实”。

实时核验摘要

  • 正式名称:AncientPoetry / chinese-poetry
  • 页面类型:GitHub 代码/数据仓库
  • 本次共核验 2 个原始链接,其中可确认 2 个、未确认 0 个
  • 核验时间:2026-08-04T10:21:48Z

访问状态中的 redirected 表示原始链接自动跳转,但最终页面仍能确认项目身份;errorskipped 不作为新增事实依据。HTTP 状态和最终地址均保留在逐站结果中,便于后续复查。

项目特色

有证据支持的特色:原条目同时保留一个轻量古诗语料仓库和一个规模更大、以 JSON 分发的中华古典文集数据库。

这一特色来自当前可访问页面的项目介绍、README 或论文摘要,并非根据项目名称推断。若要将其用于论文实验、生产数据或商业产品,还应继续核对数据来源、样本质量、许可范围与引用要求。

核心功能

  • 首个仓库仅明确说明其为自行抓取的古诗词语料。
  • 第二个仓库收录约 5.5 万首唐诗、26 万首宋诗、2.1 万首宋词,并包含诗经、论语、元曲等文集。
  • 大型仓库以 JSON 组织数据,目标是便于开发者构建诗词类应用。

上述功能描述的证据强度取决于来源类型:官方仓库 README 和论文页面可支持项目定位,但目录列表、第三方镜像或仅有标题的页面不能替代完整技术文档。性能、准确率、价格、作者承诺与未展示的功能均为待核实。

技术栈与资料范围

  • 主要技术/资料形态:JSON 数据与 Python 工具。
  • 两个来源的数据覆盖、清洗过程和许可不同,不能混为同一版本。
  • 大型仓库声明数据来自互联网,使用前仍应检查文本版权、错字与重复项。

技术语言来自仓库元数据时只代表代码占比信号,不等于完整依赖栈;“数据文件为主”或“资料索引为主”则说明该资源不宜按可安装软件理解。数据字段、切分、清洗、标注一致性、去重和覆盖偏差仍需结合仓库文件或论文正文审计。

适用场景

  • 用于与“古诗词库”原始定位一致的数据调研、基线复现或资料索引。
  • 在小规模样本上验证格式、编码、字段与任务匹配度,再决定是否纳入正式实验。
  • 将当前页面作为入口,继续核对数据下载、论文引用、许可证和维护记录。

如果项目是数据列表或资源集合,应逐个核验其下游数据源;如果项目是模型或工具仓库,也不能仅凭仓库可克隆就认定模型文件、训练数据和运行环境仍然可用。

安装或使用入口

  • git clone https://github.com/panhaiqi/AncientPoetry.git

克隆仓库只是取得资料的入口,不等同于完成安装。执行任何命令前应先检查当前分支、依赖文件、下载脚本和数据条款。对于论文 PDF 或失效链接,本次未确认可执行安装流程,安装方式为待核实

实践建议

  1. 先保存原始文件校验值,并记录下载日期、最终 URL 与版本线索,避免后续页面变化导致实验不可复现。
  2. 抽样检查编码、空值、重复项、异常长度和标签分布;涉及文本语料时还要检查隐私、冒犯内容与版权风险。
  3. 先运行最小样例,再扩大数据规模; README 中的历史命令可能依赖旧版框架或已经迁移的下载地址。
  4. 发表结果或上线前,重新核对许可证、引用格式和数据再分发限制。

优势与限制

优势:该条目提供了明确的项目入口;本次可访问页面还给出了“原条目同时保留一个轻量古诗语料仓库和一个规模更大、以 JSON 分发的中华古典文集数据库。”这一可追溯特色,有助于判断是否值得进一步下载和审计。

限制:目录描述可能早于当前页面,仓库可访问也不代表依赖仍兼容。当前未确认的版本、完整数据统计、基准成绩、硬件要求、商业授权、隐私合规与长期维护承诺均不能默认成立。

维护状态、版本与许可证

  • 维护状态:待核实。
  • 最近代码推送:待核实。
  • 页面/仓库更新时间:待核实。
  • 正式版本:待核实;未把分支名或单次提交自动视为稳定版本。
  • 许可证:第二个仓库为 MIT;首个仓库待核实。数据许可与代码许可可能不同,使用前应检查当前 LICENSE、README 和数据来源条款。

原始链接与逐站访问结果

URL状态HTTP页面标题最终地址证据摘要/原因
原始链接
https://github.com/panhaiqi/AncientPoetry
verified200GitHub - panhaiqi/AncientPoetry: 古诗词语料库 · GitHubhttps://github.com/panhaiqi/AncientPoetry古诗词语料库;AncientPoetry;古诗词语料库. Contribute to panhaiqi/AncientPoetry development by creating an account on GitHub.;AncientPoetry 古诗词语料 自己爬的,不解释
原始链接
https://github.com/chinese-poetry/chinese-poetry
verified200GitHub - chinese-poetry/chinese-poetry: The most comprehensive database of Chinese poetry 🧶最全中华古诗词数据库, 唐宋两朝近一万四千古诗人, 接近5.5万首唐诗加26万宋诗. 两宋时期1564位词人,21050首词。 · GitHubhttps://github.com/chinese-poetry/chinese-poetryThe most comprehensive database of Chinese poetry 🧶最全中华古诗词数据库, 唐宋两朝近一万四千古诗人, 接近5.5万首唐诗加26万宋诗. 两宋时期1564位词人,21050首词。;chinese-poetry;The most comprehensive database of Chinese poetry 🧶最全中华古诗词数据库, 唐宋两朝近一万四千古诗人, 接近5.5万首唐诗加26万宋诗. 两宋时期1564位词人,21050首词。 - chinese-poetry/chinese-poetry;chinese-poetry: 最全中文诗歌古典文集数据库 最全的中华古典文集数据库,包含 5.5 万首唐诗、26 万首宋诗、2.1 万首宋词和其他古典文集。诗人包括唐宋两朝近 1.4 万古诗人,和两宋时期 1.5 千古词人。数据来源于互联网。;为什么要做这个仓库?** 古诗是中华民族乃至全世界的瑰宝,我们应该传承下去,虽然有古典文集,但大多数人并没有拥有这些书籍。从某种意义上来说,这些庞大的文集离我们是有一定距离的。而电子版方便拷贝,所以此开源数据库诞生了。此数据库通过 JSON 格式分发,可以让你很方便的开始你的项目。
原始记录

项目名:古诗词库

原始描述:

章节:语料库

行号:331

核验清单

  • slug 保持为 github-com-panhaiqi-ancientpoetry,未改名、未合并项目。
  • 全部 2 个原始链接已保留,并分别生成 sourceChecks 记录。
  • 页面类型、正式名称、功能、技术范围、入口、维护线索、更新时间和许可证均按当前证据填写;缺失项标为“待核实”。
  • 文章包含项目特色、优势与限制以及逐站访问结果,且不使用失效页面推断新增事实。

规范链接:/articles/github-com-panhaiqi-ancientpoetry-polished-guide