GTX 1080 Ti против 176B-моделей: энтузиаст сравнил MoE-архитектуры для llama-server
Оригинал: GTX 1080 Ti не сдаётся: выбираем лучшую MoE-модель для llama-server среди 35B, 120B и 176B
Конспект редакции
Автор Хабра протестировал 35B, 120B и 176B MoE-модели на легендарной GTX 1080 Ti, показав, что даже на устаревшем железе можно запускать топовые LLM — но с оговорками.
Материал на Хабре посвящён практическому сравнению MoE-моделей классов 35B, 120B и 176B при запуске через llama-server на устаревающей, но всё ещё рабочей GTX 1080 Ti. Автор продолжает серию экспериментов с локальным инференсом больших моделей на потребительском железе.
Отправной точкой стал опыт других энтузиастов, запустивших Qwen 3.8-27B на двух RTX 5060 Ti с суммарными 32 ГБ памяти. Это показывает, что MoE-архитектуры позволяют эффективнее расходовать VRAM и делают локальный запуск крупных моделей реалистичным даже без профессиональных ускорителей.
Для киноиндустрии такие эксперименты важны косвенно: локальный инференс снижает зависимость от облачных сервисов и открывает возможности для приватной работы с ИИ-инструментами — от превизуализации до обработки материалов. Конкретные бенчмарки и выводы автора — в полной статье на Хабре.
Материал агрегирован; полный текст — на сайте Хабр — ИТ-новости.
Почему это важно
Для индустрии это сигнал: локальный инференс больших MoE-моделей перестаёт быть уделом дата-центров и становится доступен небольшим студиям и независимым разработчикам.
Контекст
Ранее тот же автор уже запускал 176B-класс Qwen3.8-Flash-Next на GTX 1080 Ti как эксперимент. Новая статья — продолжение с системным сравнением нескольких MoE-моделей.
Влияние на индустрию
Снижение порога входа для локального ИИ-инференса может ускорить появление инструментов для препродакшна, монтажа и генерации контента у небольших команд без облачных бюджетов.
Что дальше
Фото (4)
Упоминается
Комментарий редактора Игоря
Пока это скорее технический подвиг, чем рабочий пайплайн, но именно такие эксперименты через год-два становятся стандартом индустрии.




