Перейти к содержимому
Позвоните нам, чтобы обсудить ваш проект!

Model Quantization


Model Quantization (квантование модели) — это процесс понижения точности числовых параметров нейросети: веса и активации, обычно хранящиеся в 32-битных числах с плавающей точкой (FP32), переводятся в 16-, 8- или даже 4-битные форматы (FP16, INT8, INT4). Цель — уменьшить размер модели, ускорить инференс и снизить требования к памяти, сохранив при этом приемлемое качество предсказаний. Например, модель на 7 млрд параметров в FP16 занимает около 14 ГБ, а после INT8-квантования — примерно 7 ГБ, что позволяет запускать её на потребительской видеокарте.

Как работает квантование

  • Выбирается шкала (scale) и точка смещения (zero-point), которые отображают диапазон FP32-значений на целочисленный диапазон, например −128…127 для INT8.
  • Веса округляются до ближайшего целого в этом диапазоне; ошибка округления компенсируется калибровкой на реальных данных.
  • При инференсе целочисленные операции выполняются быстрее и потребляют меньше энергии, особенно на GPU с поддержкой INT8-тензоров.
  • Различают посттренировочное квантование (PTQ) и квантование с учётом обучения (QAT), где модель дообучается с имитацией пониженной точности.

Где это применяется на практике

Квантование критично для развёртывания LLM на периферии: смартфонах, встраиваемых устройствах, локальных серверах без мощных GPU. Оно напрямую влияет на скорость отдачи страниц с AI-функциями, поэтому при подготовке сайтов под нагрузку стоит учитывать оптимизацию сайта и техническую поддержку — они помогают удержать стабильный отклик при интеграции моделей.

Форматы и компромиссы

  1. FP16/BF16 — минимальная потеря качества, экономия памяти примерно вдвое.
  2. INT8 — баланс между размером и точностью, широко поддерживается фреймворками вроде TensorRT и ONNX Runtime.
  3. INT4 и ниже (GPTQ, AWQ, GGUF) — максимальная экономия, но возможна деградация на сложных задачах рассуждения.
  4. Смешанное квантование оставляет чувствительные слои в высокой точности, а остальные сжимает агрессивнее.

Для проектов, где важна скорость загрузки и работа с AI-контентом, квантование часто сочетают с разработкой сайтов под конкретную инфраструктуру. Связанные темы: LLM, инференс, трансформер.


Еще на эту тему