NVIDIA пусна отворен инструмент, който свива големи AI модели, за да се побират в по-малко видеопамет

coolice

Owner
NVIDIA официално развива като отворен код библиотеката Model-Optimizer (ModelOpt) — набор от техники за компресиране на големи езикови модели, когато видеопаметта не стига за нормално пускане.

Инструментът събира в един Python интерфейс квантизация, прунинг, дестилация, разреждане и speculative decoding. Разработчикът подава модел от Hugging Face, PyTorch или ONNX, комбинира няколко оптимизации и експортира checkpoint, който се пуска директно във vLLM, SGLang, TensorRT-LLM или TensorRT. От страна на обучението библиотеката се връзва и с Megatron-LM, Megatron-Bridge и Hugging Face Accelerate.

Проблемът, който решава, е добре познат: екип иска да разположи малко по-голям модел, а GPU паметта не достига с малко. Досега изборът често беше или по-скъпа карта, или съкратен контекст. Според NVIDIA квантизацията може да намали размера на модела около 2–4 пъти, като запази приемливо качество.

Готови компресирани варианти вече са качени в Hugging Face, сред които DeepSeek-R1-FP4, Llama-3.3-70B-Instruct-FP4 и Llama-3.1-405B-Instruct-FP4. Има и публичен промишлен пример: компанията Domyn е свила 355-милиарден модел до 260 милиарда параметъра чрез прунинг и дестилация.Проектът е с лиценз Apache 2.0. В GitHub хранилището има около 4400 звезди и над 600 форка, а в документацията има готови рецепти и помощни умения за среди като Claude Code и Codex.


Кодът и документацията са достъпни тук:
 
Отдавна чакам за нещо подобно сега се мъча с разни 7B-та 🤣 🤣 🤣 🤣

МоделOff-by-oneEvidenceFinal code
2B Q4❌✅❌
4B Q4❌✅ ❌
7B Q3❌✅❌
7B Q4✅✅⚠️ почти


Макар, че официално до сега NVIDIA имат добри резултати когато свиването е умерено. Не да грабнеш един 32B и да го сплескaш 6B :)


lagent.png
 
Другия месец илизат RTX спарковете във формат Mini PC и лаптоп разликата с DGX спарк а е че нямат 200 гигабитовата оптична мрежова карта и ще ги има с по-малко рам от 128ГБ тоес не може да се клъстерират ефикасно но ще са по евтини тя само картата вдига с 1000 евро цената...

Nvida им трябва софтуер да прави този хардуер ценен за потребителите им :) та затова опен нещица а майкросот със спадащия си пазарен дял бързат да се наместят




 
Raspberry Pi също вече имат ускорител за LLM модели - Hailo-10H neural processing unit (40 TOPS INT4) 8GB dedicated RAM, allowing it to run local Large Language Models (LLMs) and Vision-Language Models (VLMs) without consuming the host Raspberry Pi 5 system RAM.

Вярно за сега само за малки модели, но с с компресията на NIVIDA може да стане интересно.
 
За 8GB RAM вероятно Bonsai трендва напоследък


Нямам идея как ще върви на Pi то но модела въпреки екстремния Quant има някакви възможности както се вижда на видеото
 
За Pi + ускорител HAILO се конвертират в техен формат .hev. A ако имаш хубава машина може и да си обучаваш. Там работата не да казваш Pi + HAILO бие NVIDIA 9999 128 RAM а да имаш мощни модели за локална употреба. За това ме кефят edge системите с дребен хардуер може да правиш чудеса ;)
 

Горе