NVIDIA пусна отворен инструмент, който свива големи AI модели, за да се побират в по-малко видеопамет

coolice

Owner
NVIDIA официално развива като отворен код библиотеката Model-Optimizer (ModelOpt) — набор от техники за компресиране на големи езикови модели, когато видеопаметта не стига за нормално пускане.

Инструментът събира в един Python интерфейс квантизация, прунинг, дестилация, разреждане и speculative decoding. Разработчикът подава модел от Hugging Face, PyTorch или ONNX, комбинира няколко оптимизации и експортира checkpoint, който се пуска директно във vLLM, SGLang, TensorRT-LLM или TensorRT. От страна на обучението библиотеката се връзва и с Megatron-LM, Megatron-Bridge и Hugging Face Accelerate.

Проблемът, който решава, е добре познат: екип иска да разположи малко по-голям модел, а GPU паметта не достига с малко. Досега изборът често беше или по-скъпа карта, или съкратен контекст. Според NVIDIA квантизацията може да намали размера на модела около 2–4 пъти, като запази приемливо качество.

Готови компресирани варианти вече са качени в Hugging Face, сред които DeepSeek-R1-FP4, Llama-3.3-70B-Instruct-FP4 и Llama-3.1-405B-Instruct-FP4. Има и публичен промишлен пример: компанията Domyn е свила 355-милиарден модел до 260 милиарда параметъра чрез прунинг и дестилация.Проектът е с лиценз Apache 2.0. В GitHub хранилището има около 4400 звезди и над 600 форка, а в документацията има готови рецепти и помощни умения за среди като Claude Code и Codex.


Кодът и документацията са достъпни тук:
 
Отдавна чакам за нещо подобно сега се мъча с разни 7B-та 🤣 🤣 🤣 🤣

МоделOff-by-oneEvidenceFinal code
2B Q4❌✅❌
4B Q4❌✅ ❌
7B Q3❌✅❌
7B Q4✅✅⚠️ почти


Макар, че официално до сега NVIDIA имат добри резултати когато свиването е умерено. Не да грабнеш един 32B и да го сплескaш 6B :)


lagent.png
 
Другия месец илизат RTX спарковете във формат Mini PC и лаптоп разликата с DGX спарк а е че нямат 200 гигабитовата оптична мрежова карта и ще ги има с по-малко рам от 128ГБ тоес не може да се клъстерират ефикасно но ще са по евтини тя само картата вдига с 1000 евро цената...

Nvida им трябва софтуер да прави този хардуер ценен за потребителите им :) та затова опен нещица а майкросот със спадащия си пазарен дял бързат да се наместят




 
Raspberry Pi също вече имат ускорител за LLM модели - Hailo-10H neural processing unit (40 TOPS INT4) 8GB dedicated RAM, allowing it to run local Large Language Models (LLMs) and Vision-Language Models (VLMs) without consuming the host Raspberry Pi 5 system RAM.

Вярно за сега само за малки модели, но с с компресията на NIVIDA може да стане интересно.
 

Горе