LLMCOD перешёл на Qwen 3.8: 2× параллельность, 32K контекст и MTP-ускорение на V100

Habr ·

LLMCOD перешёл на Qwen 3.8: 2× параллельность, 32K контекст и MTP-ускорение на V100

До обновления API LLMCOD работал на Qwen 3.6. Модель справлялась, но по мере роста числа клиентов и усложнения промптов (длинные базы знаний, многошаговые диалоги, агенты) стало понятно: нужен более свежий бэкенд с лучшим качеством推理 и более эффективным использованием GPU. Цель — получить максимум от имеющегося железа (Tesla V100-SXM2-32GB), не покупая новый GPU. Читать далее

До обновления API LLMCOD работал на Qwen 3.6. Модель справлялась, но по мере роста числа клиентов и усложнения промптов (длинные базы знаний, многошаговые диалоги, агенты) стало понятно: нужен более свежий бэкенд с лучшим качеством推理 и более эффективным использованием GPU. Цель — получить максимум от имеющегося железа (Tesla V100-SXM2-32GB), не покупая новый GPU. Читать далее

Источник: Habr