VPS для LLM: обзор и сравнение
Серверы под языковые модели: 44 провайдера, вход от 59 ₽. Расчёт видеопамяти по размеру модели, квантование, что можно запустить на процессоре.
Под такие параметры в срезе ничего нет — ослабьте отбор.
Запуск языковой модели на своём сервере упирается в один параметр — объём памяти под веса. Грубый расчёт: модель в полной точности требует примерно вдвое больше гигабайт памяти, чем у неё миллиардов параметров. Квантование снижает требования в два-четыре раза ценой небольшой потери качества, и именно так модели чаще всего и запускают.
Отсюда практические варианты. Компактные модели после квантования помещаются в 8–12 ГБ видеопамяти и работают на доступных картах. Модели среднего размера требуют 24 ГБ и выше. Запуск на процессоре возможен и не требует ускорителя вовсе, но скорость генерации падает до единиц слов в секунду — для фоновой обработки это приемлемо, для интерактивного чата нет.
Что ещё учесть: объём диска под веса, скорость загрузки модели в память при перезапуске и стабильность канала, если модель обслуживает внешние запросы.