用最专业的眼光看待互联网
立即咨询想要在本地运行大型模型时,硬件配置通常随模型规模的增大而提升。随着模型参数的增多,显存和计算能力的需求也随之增加。如此庞大的千亿参数级模型在家庭电脑上实现几乎是不可想象的。然而,今天介绍的开源项目Colibri为此提供了一种创新的解决方案。
01 项目概述 Colibri是一个专门用于MoE(Mixture of Experts)大模型推理的引擎,使用纯C语言开发。MoE架构的一个显著特点是,它能够支持744亿参数的模型,但在生成一个token时,真正激活的参数仅约为400亿。在这一过程中,相邻两个token之间实际切换的参数只有大约11GB。
02 项目优势 1. 磁盘流式加载:Colibri将显存、内存和硬盘视为同一存储层次。模型权重存储为int4格式,依据路由热度从NVMe上流式地加载需要的专家。它还能够记忆常用专家,保持更新,并将最热的专家缓存至内存中。 2. 压缩缓存且不改模型:Colibri的KV缓存压缩了57倍,每个token占用576个浮点数,而不是32768个,并支持跨重启持久保存,可以在对话中温启动恢复,确保结果与之前一致。 3. 原生MTP推测解码:GLM-5.2的MTP头部能够起草token,主模型则会进行一次性前向验证,验证2.2至2.8个token。需注意,MTP头必须是int8格式,不然将无效。 4. 兼容OpenAI API:该项目提供的接口可以轻松启动一个兼容OpenAI的API,任何支持自定义OpenAI端点的客户端均可接入。
03 快速上手 1. 准备工作:下载程序(仅几百KB)与模型(372GB)。 2. 安装步骤:从Release页面下载适合自己平台的预编译包,支持Linux、macOS和Windows,通过简单的解压和命令就可以启动,只需安装Python 3作为启动器和API网关。模型的int4版本可在Hugging Face上获取,另外也可从FP8源进行转换,无需一次性释放756GB。 3. 运行方式:通过设置模型路径运行简单的命令即可自动检测RAM和缓存,用户可查看VRAM/RAM/硬盘配置,并进行就绪检查,同时可开启API或网页仪表板。
04 总结 Colibri的最大价值在于,它允许在仅有25GB内存的情况下也能运行千亿参数的大模型。如果你面临硬件限制但想要拥有而非租用智能服务,不妨试试看。感谢你的阅读,我们下次再见!
地址:南安市村钞星海79号