腾讯混元Hy4 preview轻量版发布:1.5TB模型压缩至214GB
腾讯混元推出Hy4 preview轻量版。该版本通过两项核心技术将模型权重从接近1.5TB压缩至约214GB:一是自研Sherry稀疏三值量化算法,将最激进一档权重压至平均1.25比特;二是MIX-S 2026-9-1 05:50:26 Author: blog.upx8.com(查看原文) 阅读量:33 收藏

腾讯混元推出Hy4 preview轻量版。该版本通过两项核心技术将模型权重从接近1.5TB压缩至约214GB:一是自研Sherry稀疏三值量化算法,将最激进一档权重压至平均1.25比特;二是MIX-STQ1_0混合精度策略,按敏感度逐层决定每层比特数,在同等平均比特预算下实现更低量化误差。压缩后模型在长文理解、多轮长上下文检索与原始版本基本持平。量化GGUF库及相关代码已开源。

腾讯混元还验证了异构设备联合推理方案:在一台4090笔记本与一台四卡A4000服务器(显存合计80GB、内存64GB)上,通过调度将MoE层拆开分配,协同运行速度达1.02 token/s,较笔记本单机offload提升约6倍。

—— 凤凰网科技


文章来源: https://blog.upx8.com/%E8%85%BE%E8%AE%AF%E6%B7%B7%E5%85%83Hy4-preview%E8%BD%BB%E9%87%8F%E7%89%88%E5%8F%91%E5%B8%83-1-5TB%E6%A8%A1%E5%9E%8B%E5%8E%8B%E7%BC%A9%E8%87%B3214GB
如有侵权请联系:admin#unsafe.sh