开发者在8GB内存上部署Kimi K3模型并成功运行 只是...速度为33秒/Token
2026-8-3 04:0:53 Author: www.landian.news(查看原文) 阅读量:19 收藏

#人工智能 有开发者在本地部署 Kimi K3 模型,仅需 8.24GB 内存就可以实现运行,只是运行速度为 33 秒 / Token (注意看单位)。如果将内存提升到 128GB 则可以实现 20 秒 / Token,不过这也基本是性能上限,继续堆内存无法继续提高效率。目前开发者已经将基于 C99 开发的推理引擎开源,有兴趣的用户可以研究看看。查看全文:https://ourl.co/114176

开发者 FareedKhan 想要在自己的机器上测试 Kimi K3 模型,正常来说消费级设备是肯定无法运行这种规模的模型,但开发者使用 C99 写了个推理引擎实现了本地运行,最快的情况下模型速度可以达到 20 秒 / Token,不过在 8GB 内存的情况下运行速度为 33 秒 / Token (注意看单位)。

这个推理引擎的核心就是尝试在不使用显卡、深度学习框架或 BLAS 库的情况下,让 Kimi K3 可以在单颗 CPU+8GB 内存的环境中完成推理,当然项目本身并不追求实用性能,重点是通过实现推理流程理解 Kimi K3 的混合专家架构,以及验证超大规模模型在低内存设备上运行的可行性。

开发者在8GB内存上部署Kimi K3模型并成功运行 只是...速度为33秒/Token

Kimi K3 的模型检查点体积约为 1.56TB,其中约 93% 是路由专家权重,模型每次生成 Token 时 896 个专家中仅会激活 16 个,因此项目没有将全部专家权重加载到内存中,而是将其保留在 NVMe 固态硬盘中,在需要的时候再读取和直接参与计算。

这些专家权重采用打包的 4-bit 格式存储,推理时直接从该格式进行乘法运算,省去常规的完整反量化步骤。模型的稠密主干部分则被重新打包为单文件,各层权重按照各层偏移量排列,推理时一次流式读取一层,用户可以通过设置内存预算,在内存和速度之间取舍。

最低仅需 8.24GB 内存,但速度为 33 秒 / Token:

开发者在配备两颗 AMD EPYC 7763 和 NVMe SSD 的机器上进行测试,机器内四张 GPU 全程未被使用,在最小预设下,进程峰值内存占用为 8.24GB,只不过这时候运行速度非常缓慢,每生成 1 个 Token 大约需要 33 秒。

如果将内存预算提升到 128GB 且继续不使用 GPU,模型速度可以达到每生成 1 个 Token 花费 20 秒,这已经接近该实现的性能上限,所以继续堆内存也基本无法再继续提高模型的吞吐效率。

开发者称,不同内存预设下的输出结果保持字节级一致,这说明调整缓存和权重读取策略不会改变模型推理结果,但也反映出存储读取和 CPU 计算已经成为主要瓶颈。

项目地址:https://github.com/FareedKhan-dev/kimi-k3-in-c/

即将结束终于补货!99元/年境外CN2服务器又可以购买,限量销售,售完即止。另有3年超低价国内VPS服务器。

  • ICANN已完成顶级域名.web的委派 威瑞信计划从下半年开放域名注册

  • OpenAI发现更多智能体逃逸案例 但目前尚未公开发布完整的内部调查细节

  • 微软首次明确将8GB内存作为优化目标 要优化Windows 11在8GB内存的使用体验

  • Codex再次重置周额度 而且目前测试5小时限额也没有恢复 所以还能敞开用

  • <b>CF/TK/GQ所有免费域名已在7月31日到期 必须付费注册后才能继续使用</b>

  • <b>重大噩耗!Codex已再次硬重置 但从明天开始将重新恢复5小时使用限额</b>


文章来源: https://www.landian.news/archives/114176.html
如有侵权请联系:admin#unsafe.sh