Model Quantization
Model Quantization (квантование модели) — это процесс понижения точности числовых параметров нейросети: веса и активации, обычно хранящиеся в 32-битных числах с плавающей точкой (FP32), переводятся в 16-, 8- или даже 4-битные форматы (FP16, INT8, INT4). Цель — уменьшить размер модели, ускорить инференс и снизить требования к памяти, сохранив при этом приемлемое качество предсказаний. Например, модель на 7 млрд параметров в FP16 занимает около 14 ГБ, а после INT8-квантования — примерно 7 ГБ, что позволяет запускать её на потребительской видеокарте.
Как работает квантование
- Выбирается шкала (scale) и точка смещения (zero-point), которые отображают диапазон FP32-значений на целочисленный диапазон, например −128…127 для INT8.
- Веса округляются до ближайшего целого в этом диапазоне; ошибка округления компенсируется калибровкой на реальных данных.
- При инференсе целочисленные операции выполняются быстрее и потребляют меньше энергии, особенно на GPU с поддержкой INT8-тензоров.
- Различают посттренировочное квантование (PTQ) и квантование с учётом обучения (QAT), где модель дообучается с имитацией пониженной точности.
Где это применяется на практике
Квантование критично для развёртывания LLM на периферии: смартфонах, встраиваемых устройствах, локальных серверах без мощных GPU. Оно напрямую влияет на скорость отдачи страниц с AI-функциями, поэтому при подготовке сайтов под нагрузку стоит учитывать оптимизацию сайта и техническую поддержку — они помогают удержать стабильный отклик при интеграции моделей.
Форматы и компромиссы
- FP16/BF16 — минимальная потеря качества, экономия памяти примерно вдвое.
- INT8 — баланс между размером и точностью, широко поддерживается фреймворками вроде TensorRT и ONNX Runtime.
- INT4 и ниже (GPTQ, AWQ, GGUF) — максимальная экономия, но возможна деградация на сложных задачах рассуждения.
- Смешанное квантование оставляет чувствительные слои в высокой точности, а остальные сжимает агрессивнее.
Для проектов, где важна скорость загрузки и работа с AI-контентом, квантование часто сочетают с разработкой сайтов под конкретную инфраструктуру. Связанные темы: LLM, инференс, трансформер.
