TOPIC INDEX

NLP / LLM 资源

该主题下的全部技术记录与实践总结。

篇主题文章
1215
页内容
102

LLMTune: 在消费级GPU上微调大型65B+LLM

可以在普通消费级GPU上进行4位微调,例如最大的65B LLAMA模型。LLMTune还实现了LoRA算法和GPTQ算法来压缩和量化LLM,并通过数据并行处理大型模型。此外,LLMTune...

阅读全文

QLoRA--Guanaco

一种高效的微调方法,可以在单个48GB的GPU上微调一个拥有65B参数的模型,同时保持完整的16位微调任务性能,并通过QLoRA将梯度反向传播通过一个冻结的、4位量化的预训练语言模型到低秩...

阅读全文

WizardLM

赋予大型预训练语言模型遵循复杂指令的能力,使用完整进化指令(约300k)训练的WizardLM-7B模型

阅读全文

Guidance

引导能够比传统的提示或链接更有效地控制现代语言模型,并且更高效。引导程序允许您将生成、提示和逻辑控制交错到单一连续流中,与语言模型实际处理文本的方式相匹配。像"Chain of Thoug...

阅读全文

Langchain

大型语言模型(LLMs)正在成为一项具有变革性的技术,使开发者能够构建以前无法实现的应用程序。然而,仅仅使用这些独立的LLMs通常不足以创建一个真正强大的应用程序 - 真正的力量来自于能够...

阅读全文

MosaicML

MPT-7B-StoryWriter,65K tokens,可以把《了不起的盖茨比》都一次性扔进去。

阅读全文

Lit-LLaMA

基于Apache 2.0许可证完全开源的LLaMA独立实现,建立在nanoGPT之上,旨在解决原始LLaMA代码采用GPL许可证的限制,以实现更广泛的学术和商业应用

阅读全文

Chinese-ChatLLaMA

中文ChatLLaMA对话模型;预训练/指令微调数据集,基于 TencentPretrain 多模态预训练框架构建,支持简繁体中文、英文、日文等多语言

阅读全文