coolice
Owner
NVIDIA официално развива като отворен код библиотеката Model-Optimizer (ModelOpt) — набор от техники за компресиране на големи езикови модели, когато видеопаметта не стига за нормално пускане.
Инструментът събира в един Python интерфейс квантизация, прунинг, дестилация, разреждане и speculative decoding. Разработчикът подава модел от Hugging Face, PyTorch или ONNX, комбинира няколко оптимизации и експортира checkpoint, който се пуска директно във vLLM, SGLang, TensorRT-LLM или TensorRT. От страна на обучението библиотеката се връзва и с Megatron-LM, Megatron-Bridge и Hugging Face Accelerate.
Проблемът, който решава, е добре познат: екип иска да разположи малко по-голям модел, а GPU паметта не достига с малко. Досега изборът често беше или по-скъпа карта, или съкратен контекст. Според NVIDIA квантизацията може да намали размера на модела около 2–4 пъти, като запази приемливо качество.
Готови компресирани варианти вече са качени в Hugging Face, сред които DeepSeek-R1-FP4, Llama-3.3-70B-Instruct-FP4 и Llama-3.1-405B-Instruct-FP4. Има и публичен промишлен пример: компанията Domyn е свила 355-милиарден модел до 260 милиарда параметъра чрез прунинг и дестилация.Проектът е с лиценз Apache 2.0. В GitHub хранилището има около 4400 звезди и над 600 форка, а в документацията има готови рецепти и помощни умения за среди като Claude Code и Codex.
Кодът и документацията са достъпни тук:
github.com
Инструментът събира в един Python интерфейс квантизация, прунинг, дестилация, разреждане и speculative decoding. Разработчикът подава модел от Hugging Face, PyTorch или ONNX, комбинира няколко оптимизации и експортира checkpoint, който се пуска директно във vLLM, SGLang, TensorRT-LLM или TensorRT. От страна на обучението библиотеката се връзва и с Megatron-LM, Megatron-Bridge и Hugging Face Accelerate.
Проблемът, който решава, е добре познат: екип иска да разположи малко по-голям модел, а GPU паметта не достига с малко. Досега изборът често беше или по-скъпа карта, или съкратен контекст. Според NVIDIA квантизацията може да намали размера на модела около 2–4 пъти, като запази приемливо качество.
Готови компресирани варианти вече са качени в Hugging Face, сред които DeepSeek-R1-FP4, Llama-3.3-70B-Instruct-FP4 и Llama-3.1-405B-Instruct-FP4. Има и публичен промишлен пример: компанията Domyn е свила 355-милиарден модел до 260 милиарда параметъра чрез прунинг и дестилация.Проектът е с лиценз Apache 2.0. В GitHub хранилището има около 4400 звезди и над 600 форка, а в документацията има готови рецепти и помощни умения за среди като Claude Code и Codex.
Кодът и документацията са достъпни тук:
GitHub - NVIDIA/Model-Optimizer: A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment fra
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downs...
