AI/ML · 27 сентября 2026, 14:26

Liquid AI выпустила DSpark-ускоритель для vision-language модели LFM2.5-VL-3B

Liquid AI представила черновик-декодер LFM2.5-VL-DSpark для модели LFM2.5-VL-3B, ускоряющий декодирование на устройстве до 3,13 раза и на H100 до 2,66 раза. Дополнительные параметры занимают всего 8,9% от базовой модели.

Liquid AI выпустила модель-черновик LFM2.5-VL-DSpark, предназначенную для спекулятивного декодирования в vision-language модели LFM2.5-VL-3B. Решение поддерживается с первого дня в llama.cpp, MLX-VLM и SGLang.

По данным компании, на устройстве с чипом M5 Max и фреймворком MLX скорость декодирования вырастает в 2,30–3,13 раза в зависимости от задачи, а сквозная задержка — в 1,56–2,62 раза. На llama.cpp с M3 Ultra ускорение декодирования достигает 1,57–2,14 раза. На GPU H100 декодирование ускоряется до 2,66 раза, сквозной прирост — до 2,27 раза.

Драфтер содержит около 280 млн параметров и использует архитектуру с четырьмя слоями внимания при размере блока 9. По словам авторов, спекулятивное декодирование ускоряет только этап декодирования и не затрагивает кодирование изображения и префилл, поэтому выигрыш ограничен законом Амдала.

Модели доступны на Hugging Face в форматах Safetensors и GGUF.

Источник: Hugging Face Blog