LFM2.5-VL-DSpark 加速视觉语言模型,端侧解码最高提速 3.13 倍
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以投机解码加速视觉语言模型推理,端侧解码最高提速 3.13 倍,H100 上最高 2.66 倍。草稿模型约 280M 参数,使部署模型参数量仅增加 8.9%,首发支持 llama.cpp、MLX-VLM 和 SGLang。投机解码只加速解码阶段,视觉编码与 prefill 仍会限制端到端收益。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以投机解码加速视觉语言模型推理,端侧解码最高提速 3.13 倍,H100 上最高 2.66 倍。草稿模型约 280M 参数,使部署模型参数量仅增加 8.9%,首发支持 llama.cpp、MLX-VLM 和 SGLang。投机解码只加速解码阶段,视觉编码与 prefill 仍会限制端到端收益。
Retrieve-for-Train 框架通过离线强化学习将查询扇出编译为监督信号,再蒸馏进 53.9M 参数扩散检索器,推理时以单次非自回归前向生成完整目标嵌入集,绕开 CoT 推理 token 带来的推理瓶颈。该框架出自 ICML 2026 论文,并用强化学习微调了 Gemma3-4B 和 Qwen3-4B。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个实时语音对话模型,主打智能提升与并行推理,用户可用语音完成复杂任务。
推荐理由:语音模型在对话延迟、多步推理和成本之间给出新选项,并公布了多个语音基准排名,便于开发者选型。