维基大规模平行文本语料
所属章节:语料库|manifest 索引:169|原始行号:330
85种语言、1620种语言对、135M对照句
项目简介
本条目在原始目录中名为“维基大规模平行文本语料”。本次实时核验后,可访问来源显示其正式名称或仓库名为“WikiMatrix”,入口类型为GitHub 代码/数据仓库。README 报告约 1.34 亿条平行句,其中约 3,400 万条与英语对齐。
本文只陈述核验时页面能够支持的事实。原始目录与当前页面不一致之处,以“原始记录”和“实时证据”分别呈现;没有在页面、README、仓库元数据或论文摘要中出现的信息均标为“待核实”。
实时核验摘要
- 正式名称:WikiMatrix
- 页面类型:GitHub 代码/数据仓库
- 本次共核验 1 个原始链接,其中可确认 1 个、未确认 0 个
- 核验时间:2026-08-04T10:21:42Z
访问状态中的 redirected 表示原始链接自动跳转,但最终页面仍能确认项目身份;error 或 skipped 不作为新增事实依据。HTTP 状态和最终地址均保留在逐站结果中,便于后续复查。
项目特色
有证据支持的特色:使用 LASER 句向量、FAISS 快速检索和 margin 分数,从维基百科中挖掘 85 种语言、1,620 个语言对的平行句。
这一特色来自当前可访问页面的项目介绍、README 或论文摘要,并非根据项目名称推断。若要将其用于论文实验、生产数据或商业产品,还应继续核对数据来源、样本质量、许可范围与引用要求。
核心功能
- README 报告约 1.34 亿条平行句,其中约 3,400 万条与英语对齐。
- 提供按语言对下载的 TSV 文件,以及阈值可调的 extract.py 提取工具。
- 挖掘前执行句子切分、去重和语言识别,并以机器翻译实验评估部分语对质量。
上述功能描述的证据强度取决于来源类型:官方仓库 README 和论文页面可支持项目定位,但目录列表、第三方镜像或仅有标题的页面不能替代完整技术文档。性能、准确率、价格、作者承诺与未展示的功能均为待核实。
技术栈与资料范围
- 主要技术/资料形态:Python。
- 全部语言对打包文件约 65 GB;页面提醒不要循环请求所有单文件。
- 自动挖掘数据可能包含错误对齐,margin 阈值越高通常数据越少、可靠性越高。
- 原始目录保留的描述为:85种语言、1620种语言对、135M对照句。
技术语言来自仓库元数据时只代表代码占比信号,不等于完整依赖栈;“数据文件为主”或“资料索引为主”则说明该资源不宜按可安装软件理解。数据字段、切分、清洗、标注一致性、去重和覆盖偏差仍需结合仓库文件或论文正文审计。
适用场景
- 用于与“维基大规模平行文本语料”原始定位一致的数据调研、基线复现或资料索引。
- 在小规模样本上验证格式、编码、字段与任务匹配度,再决定是否纳入正式实验。
- 将当前页面作为入口,继续核对数据下载、论文引用、许可证和维护记录。
如果项目是数据列表或资源集合,应逐个核验其下游数据源;如果项目是模型或工具仓库,也不能仅凭仓库可克隆就认定模型文件、训练数据和运行环境仍然可用。
安装或使用入口
git clone https://github.com/facebookresearch/LASER.gitwget https://dl.fbaipublicfiles.com/laser/WikiMatrix/v1/WikiMatrix.en-fr.tsv.gzwget https://dl.fbaipublicfiles.com/laser/WikiMatrix/WikiMatrix.v1.1620_language_pairs.tar
克隆仓库只是取得资料的入口,不等同于完成安装。执行任何命令前应先检查当前分支、依赖文件、下载脚本和数据条款。对于论文 PDF 或失效链接,本次未确认可执行安装流程,安装方式为待核实。
实践建议
- 先保存原始文件校验值,并记录下载日期、最终 URL 与版本线索,避免后续页面变化导致实验不可复现。
- 抽样检查编码、空值、重复项、异常长度和标签分布;涉及文本语料时还要检查隐私、冒犯内容与版权风险。
- 先运行最小样例,再扩大数据规模; README 中的历史命令可能依赖旧版框架或已经迁移的下载地址。
- 发表结果或上线前,重新核对许可证、引用格式和数据再分发限制。
优势与限制
优势:该条目提供了明确的项目入口;本次可访问页面还给出了“使用 LASER 句向量、FAISS 快速检索和 margin 分数,从维基百科中挖掘 85 种语言、1,620 个语言对的平行句。”这一可追溯特色,有助于判断是否值得进一步下载和审计。
限制:目录描述可能早于当前页面,仓库可访问也不代表依赖仍兼容。当前未确认的版本、完整数据统计、基准成绩、硬件要求、商业授权、隐私合规与长期维护承诺均不能默认成立。
维护状态、版本与许可证
- 维护状态:待核实。
- 最近代码推送:待核实。
- 页面/仓库更新时间:待核实。
- 正式版本:待核实;未把分支名或单次提交自动视为稳定版本。
- 许可证:CC BY-SA(仓库 README 对挖掘数据的声明)。数据许可与代码许可可能不同,使用前应检查当前 LICENSE、README 和数据来源条款。
原始链接与逐站访问结果
| URL | 状态 | HTTP | 页面标题 | 最终地址 | 证据摘要/原因 |
|---|---|---|---|---|---|
原始链接https://github.com/facebookresearch/LASER/tree/master/tasks/WikiMatrix | redirected | 200 | LASER/tasks/WikiMatrix at main · facebookresearch/LASER · GitHub | https://github.com/facebookresearch/LASER/tree/main/tasks/WikiMatrix | Language-Agnostic SEntence Representations;LASER;Language-Agnostic SEntence Representations. Contribute to facebookresearch/LASER development by creating an account on GitHub.;WikiMatrix: Mining 135M Parallel Sentences in 1620 Language Pairs from Wikipedia The goal of this project is to mine for parallel sentences in the textual content of Wikipedia for all possible language pairs.;Mined data 85 different languages, 1620 language pairs 134M parallel sentences, out of which 34M are aligned with English this *table shows the amount of mined parallel sentences for most of the language pairs* the mined bitext are stored on AWS and can de downloaded with the following command: Replace "en-fr" with the ISO codes of the desired language pair. |
项目名:维基大规模平行文本语料
原始描述:85种语言、1620种语言对、135M对照句
章节:语料库
行号:330
核验清单
- slug 保持为
github-com-facebookresearch-laser-tree-master-tasks-wikimatrix,未改名、未合并项目。 - 全部 1 个原始链接已保留,并分别生成 sourceChecks 记录。
- 页面类型、正式名称、功能、技术范围、入口、维护线索、更新时间和许可证均按当前证据填写;缺失项标为“待核实”。
- 文章包含项目特色、优势与限制以及逐站访问结果,且不使用失效页面推断新增事实。
规范链接:/articles/github-com-facebookresearch-laser-tree-master-tasks-wikimatrix-polished-guide


