伯克利与MIT合作推出高效大模型推理引擎
加州大学伯克利分校与麻省理工学院联合开发了一款推理引擎,这个名为FreeToken的项目在仅使用8GB显存的笔记本上,实现了对35B参数的MoE大模型的高效运行,速度可达每秒39个Token。该项目的共同作者包括Databricks的Matei Zaharia和Ion Stoica,以及MIT的Song Han和Kurt Keutzer,他们的学术背景为这一进展增添了厚重的分量。
FreeToken专注于解决消费级硬件在大模型运行中的瓶颈,发现瓶颈主要来自于PCIe带宽,而非算力。稀疏MoE模型由于只激活部分参数,处理Token时仍需在数千亿个未激活权重中进行路由,消费者硬件缺乏NVLink等高带宽连接,导致在解码过程中出现延迟,尤其当缓存未命中时,整个执行过程可能会完全停滞。
为此,FreeToken采用了一种动态协同调度策略,通过q*策略让CPU和GPU在处理任务时能协同工作。当发生缓存未命中时,GPU不会被迫等待,而是根据实时的带宽情况,动态划分Token计算任务,从而提升处理效率。此外,该系统引入了快速权重格式和弹性内存管理,以优化计算与数据传输的重叠。 龙8头号玩家
FreeToken在应对智能体执行模式的特殊需求上,也做了进一步的优化,集成了语义锚点检查点机制,以便在任务中调整参数时复用已有的计算状态,避免高昂的序列重计算。
与现有的推理引擎相比,FreeToken在相同模型上显示出显著的速度优势,比如解码速度是Ollama和llama.cpp的3到4倍,预填充速度更快6到30倍。该系统在不同硬件配备下的基准测试显示,从RTX 4060到高达753B的模型均能实现高效推理,且目前已经在FlashML.ai和GitHub上开放源代码,支持多种用户系统。
在开发者社区中,这一项目引起了广泛关注与讨论,大家一致认为,本地硬件的自主权愈发成为关注点,尤其是对于降低自托管智能体的成本具有重要意义。同时,对FreeToken的技术实现也存在一些质疑,例如理论模型与实际环境中CPU调度延迟的匹配性。 龙8头号玩家
总的来说,FreeToken为边缘计算提供了一种新的解决方案,并可能开启智能体开发的新篇章。