Вышел новый способ ускорить работу LLM на вашей видеокарте — DFlash 2.
DFlash 2 — это спекулятивный декодер, который позволяет генерировать токены параллельно, а не по одному, используя технику block diffusion drafting. В результате скорость генерации увеличивается до 16%+, а требования к VRAM можно гибко настраивать параметром n-max без потери контекстного окна или точности. DFlash 2 особенно эффективен для длинных генераций на моделях вроде Qwen3.8-27B, работая на обычных RTX 4090/3090.
DFlash 2 уже доступен в llama.cpp, а также в vllm и sglang.
DFlash — официальный GitHub
#opensource
DFlash 2 — это спекулятивный декодер, который позволяет генерировать токены параллельно, а не по одному, используя технику block diffusion drafting. В результате скорость генерации увеличивается до 16%+, а требования к VRAM можно гибко настраивать параметром n-max без потери контекстного окна или точности. DFlash 2 особенно эффективен для длинных генераций на моделях вроде Qwen3.8-27B, работая на обычных RTX 4090/3090.
DFlash 2 уже доступен в llama.cpp, а также в vllm и sglang.
DFlash — официальный GitHub
#opensource