Тази седмица в AI - Нови епизоди всяка седмица...

coolice

Owner
Една от най-силните седмици която сме имали от към нови неща (и някой ден отгоре за да хванем други новини които са свързани с новините от тази)



JoyAI Video Edit https://github.com/jd-opensource/JoyAI-Video-Edit
Реално време отворено редактиране на видео с авторегресивни дифузионни модели. Позволява да редактираш видеа по текстови инструкции, докато се възпроизвеждат (streaming), с висока скорост (до ~30 FPS при 720p).

Scope (SCoPE) https://visual-ai.github.io/scope
Метод за позиционно кодиране в видео дифузионни трансформери, който добавя лъчи от камерата като втора координата. Подобрява контрола върху камерата и качеството на генерираните видеа.

DeepSeek V4 0813 (DeepSeek-V4-Pro-0813) https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
Официална версия на DeepSeek-V4-Pro – мощна MoE езикова модел с подобрени агентни способности и дълъг контекст (до 1 милион токена).

DeepSeek Harness https://github.com/deepseek-ai/deepseek-harness
Отворена рамка за AI агенти („Everything is a Plugin“). Позволява лесно да композираш модели, инструменти, сесии и UI чрез плъгини.

Grok 4.6 https://x.ai/news/grok-4-6
Новата frontier модел от xAI (Grok 4.6) – значително подобрение спрямо 4.5 при същата цена, с фокус върху агентни задачи и ефективност.

Qwen 3.8 Max https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
Най-мощният модел от серията Qwen3.8 (2.4T параметъра, ~95B активни) – мултимодална MoE модел с 1M контекст.

MiDasheng (MiDashengLM-Gen) https://xingws.github.io/midashenglm-gen-demo/
Модел за генериране на сложни аудио сцени (реч + музика + звукови ефекти) чрез LLM + flow matching.

LTX 2.5 https://ltx.io/model/ltx-2-5
Отворена world model за генериране на видео (и аудио) с native multi-shot, по-добро разбиране на промптите и висока скорост.

Sign to text (SL2T) https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Модел на Google DeepMind за превод от жестомимичен език (sign language) в текст. Вече работи в Gboard и Live Transcribe на Pixel 11 (започва с ASL).

GPT Ultrafast https://openai.com/index/previewing-ultrafast/
Нов режим „Ultrafast“ на OpenAI – GPT-5.6 Sol работи до 14× по-бързо (до 750 токена/сек) чрез Cerebras.

Qwen 3.8 27B https://huggingface.co/Qwen/Qwen3.8-27B
Компактен 27B dense vision-language модел от Qwen3.8 – отличен за кодиране, агентни задачи и мултимодалност.

GLM 5.3 https://z.ai/blog/glm-5.3
Флагманският модел на Z.ai (GLM-5.3) – силно подобрени способности за програмиране, агенти и киберсигурност.

Gemini 3.7 Flash https://blog.google/innovation-and-...h/gemini-models/introducing-gemini-3-7-flash/
Най-интелигентният „workhorse“ модел на Google Gemini 3 серията – оптимизиран за кодиране и агентни задачи при ниска цена.

Index TTS 2.5 https://huggingface.co/IndexTeam/IndexTTS-2.5
Мощен zero-shot TTS модел с клониране на глас, контрол върху емоциите и поддръжка на китайски, английски, японски, испански и арабски.

MiniMax Music 3


Magi 2 (MAGI-2 Preview)
https://huggingface.co/sand-ai/MAGI-2-preview
114B MoE модел за генериране на видео + синхронизирано аудио (text-to-video / image-to-video) с само ~6B активни параметъра.

Cactus Needle https://cactuscompute.com/blog/needle
Много малък (26M) модел за tool-calling/function calling, оптимизиран за мобилни устройства и edge AI.
 
Последно редактирано:
Ето реалистична оценка кои от изброените модели/инструменти могат да работят на лаптоп или компютър с умерена видеокарта (примерно 8–16 GB VRAM – RTX 3060/4060/4070, лаптопни еквиваленти, или подобни).

не са само за ентусиасти ами може да го провбвате и на геиминг сетъпа си дори да е поколение две назад...

Работи добре / сравнително лесно на умерена видеокарта​


Модел / инструментПриблизителни изискванияКоментар
Cactus NeedleМного ниски (работи дори на CPU / телефони)26M параметъра – най-лекият вариант. Идеален за edge/лаптоп.
Index TTS 2.58 GB VRAM е достатъчноИзрично се споменава, че върви на 8GB карти. Отлична опция за локален TTS с клониране на глас и емоции.
MiniMax Music 38–24 GB (с оптимизации)Пълна прецизност ~24 GB, но с CPU offload пада до ~22 GB, а със streaming на language model-а стига и до 8 GB (по-бавно). Възможно на умерена карта.
Qwen 3.8 27B (квантизиран)12–16+ GB (3–4 bit)При 4-bit (~17 GB) най-добре 16–24 GB. На 12–16 GB става с по-ниска квантизация (3-bit) или offload. Добър компромис за силен локален LLM/VLM.
LTX 2.5 (по-леки режими / distilled)~12–16 GB за стартСпоменава се поддръжка на consumer GPU и дори Mac. Пълната версия е по-тежка, но по-леките режими са възможни.
MiDasheng (Gen)Умерени (базиран на малък LLM ~1.7B)Аудио генерация – вероятно върви на 8–12+ GB с подходящи настройки.


Силна единична карта (24–32 GB VRAM)​

Примери: RTX 4090, RTX 5090, RTX 6000 Ada и подобни.

МоделКоментар
Qwen 3.8 27BОтлично (4–5 bit квантизация). Комфортно с добър контекст.
MiniMax Music 3Пълна прецизност или близо до нея – без проблем.
Index TTS 2.5Работи много бързо и комфортно.
LTX 2.5Добри резултати в по-високи резолюции и по-дълги клипове.
Cactus NeedleНадхвърля нуждите (работи на всичко).
MiDashengЛесно.

По-големите модели (JoyAI Video Edit, Magi 2, DeepSeek V4-Pro, Qwen 3.8 Max, GLM 5.3) не влизат комфортно на една 24–32 GB карта.

Две карти (2× 24 GB или 2× 32 GB)​

Позволява tensor parallel / model parallel, по-дълъг контекст и по-големи модели.

МоделКоментар
Qwen 3.8 27BМного комфортно, по-дълъг контекст и по-висока скорост.
MiniMax Music 3Пълна производителност.
LTX 2.5По-добри настройки и по-високо качество.
JoyAI Video EditВъзможно в по-леки режими / по-ниска резолюция (все още не е оптимално).
По-големи квантизирани моделиМоже да се пробват някои по-големи LLM-и с offload.


DGX Spark (128 GB unified memory)​


Това е desktop AI суперкомпютър с 128 GB споделена памет (Grace Blackwell). Може да пуска значително по-големи модели локално.


МоделКоментар
Qwen 3.8 27BИзключително комфортно (дори по-висока прецизност).
DeepSeek V4 FlashРаботи (особено Flash вариантите) - халюто му е пръв приятел...
MiniMax Music 3, Index TTS, LTX 2.5Работи отлично.
По-големи модели до ~70–200BNVIDIA официално твърди поддръжка на модели до ~200B параметъра (с квантизация). Две свързани DGX Spark могат да стигнат до ~405B. ама парите стават ненормални особено както поскъпна
 
Последно редактирано:
Една от най-силните седмици която сме имали от към нови неща (и някой ден отгоре за да хванем други новини които са свързани с новините от тази)



JoyAI Video Edit https://github.com/jd-opensource/JoyAI-Video-Edit
Реално време отворено редактиране на видео с авторегресивни дифузионни модели. Позволява да редактираш видеа по текстови инструкции, докато се възпроизвеждат (streaming), с висока скорост (до ~30 FPS при 720p).

Scope (SCoPE) https://visual-ai.github.io/scope
Метод за позиционно кодиране в видео дифузионни трансформери, който добавя лъчи от камерата като втора координата. Подобрява контрола върху камерата и качеството на генерираните видеа.

DeepSeek V4 0813 (DeepSeek-V4-Pro-0813) https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
Официална версия на DeepSeek-V4-Pro – мощна MoE езикова модел с подобрени агентни способности и дълъг контекст (до 1 милион токена).

DeepSeek Harness https://github.com/deepseek-ai/deepseek-harness
Отворена рамка за AI агенти („Everything is a Plugin“). Позволява лесно да композираш модели, инструменти, сесии и UI чрез плъгини.

Grok 4.6 https://x.ai/news/grok-4-6
Новата frontier модел от xAI (Grok 4.6) – значително подобрение спрямо 4.5 при същата цена, с фокус върху агентни задачи и ефективност.

Qwen 3.8 Max https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
Най-мощният модел от серията Qwen3.8 (2.4T параметъра, ~95B активни) – мултимодална MoE модел с 1M контекст.

MiDasheng (MiDashengLM-Gen) https://xingws.github.io/midashenglm-gen-demo/
Модел за генериране на сложни аудио сцени (реч + музика + звукови ефекти) чрез LLM + flow matching.

LTX 2.5 https://ltx.io/model/ltx-2-5
Отворена world model за генериране на видео (и аудио) с native multi-shot, по-добро разбиране на промптите и висока скорост.

Sign to text (SL2T) https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Модел на Google DeepMind за превод от жестомимичен език (sign language) в текст. Вече работи в Gboard и Live Transcribe на Pixel 11 (започва с ASL).

GPT Ultrafast https://openai.com/index/previewing-ultrafast/
Нов режим „Ultrafast“ на OpenAI – GPT-5.6 Sol работи до 14× по-бързо (до 750 токена/сек) чрез Cerebras.

Qwen 3.8 27B https://huggingface.co/Qwen/Qwen3.8-27B
Компактен 27B dense vision-language модел от Qwen3.8 – отличен за кодиране, агентни задачи и мултимодалност.

GLM 5.3 https://z.ai/blog/glm-5.3
Флагманският модел на Z.ai (GLM-5.3) – силно подобрени способности за програмиране, агенти и киберсигурност.

Gemini 3.7 Flash https://blog.google/innovation-and-...h/gemini-models/introducing-gemini-3-7-flash/
Най-интелигентният „workhorse“ модел на Google Gemini 3 серията – оптимизиран за кодиране и агентни задачи при ниска цена.

Index TTS 2.5 https://huggingface.co/IndexTeam/IndexTTS-2.5
Мощен zero-shot TTS модел с клониране на глас, контрол върху емоциите и поддръжка на китайски, английски, японски, испански и арабски.

MiniMax Music 3


Magi 2 (MAGI-2 Preview)
https://huggingface.co/sand-ai/MAGI-2-preview
114B MoE модел за генериране на видео + синхронизирано аудио (text-to-video / image-to-video) с само ~6B активни параметъра.

Cactus Needle https://cactuscompute.com/blog/needle space waves
Много малък (26M) модел за tool-calling/function calling, оптимизиран за мобилни устройства и edge AI.
Благодаря за обобщението – определено има доста неща за разглеждане.
 
Епизода от вчера

H3 World
Интерактивен world model върху MiniMax-H3: клавиатурата се превръща в езикови инструкции, вързани към конкретни видео латенти. С 8 000 gameplay клипа и само 0.199% trainable параметри дава контрол върху персонаж и камера без отделен action модул.

SolarWM
Отворена инфраструктура за дълги video world models: 1.43 млн. клипа, пълен data pipeline и един фреймуърк за Wan, LTX и MiniMax-H3. Моделите се обучават на къси клипове, но се rollout-ват в реално време до минути и часове.

TimesFM-3
Новото zero-shot foundation модел на Google Research за time series. 330M параметъра, native multivariate прогнозиране, ковариати и #1 място на Gift-Eval, FEV-Bench и TIME.

Lucida
ByteDance pipeline за real-to-sim: парсва indoor видео в scene graph, генерира пълни 3D ассети и ги подрежда с VLM политика GizmoAct. Целта е симулационно готова сцена, в която всеки обект е отделен и редактируем.

VideoDeltaNet (VDN-H3)
Хибридно внимание върху MiniMax-H3: линейно за далечен контекст, softmax за близки кадри. На 8× B200 генерира 14.4 сек видео за ~11.2 сек при почти същото качество. Има и ComfyUI нода.

LLaDA-Image
Отворен 6B unified модел на inclusionAI за генерация и editing. Base е на 50 стъпки, Turbo — на 4. Силен текст в изображения, китайски/английски рендър и SOTA на Qwen-Image-Bench.

DeepSeek-V4-Flash-Vision-Exp
Първият multimodal експериментален модел в семейството V4-Flash. Запазва силните agent способности на текстовата версия и добавя визия за графики, документи и multimodal агенти (~305B / ~18B active).

Qwen3.8-Max-0902
Snapshot от 2 септември на флагмана Qwen3.8-Max (2.4T MoE). По-добър coding за дълги инженерни проекти, по-стабилни агенти и по-остра native визия. 1M контекст, thinking mode, $2 / $6 за 1M токена.

Claude Fable 5.1
Най-силният общодостъпен Claude за дълги агентни задачи, coding и knowledge work. 1M контекст, adaptive thinking, $10 / $50. По-честен при затъване и по-добър на многодневни сесии спрямо Fable 5.

Higgsfield
AI creative suite за образ, видео и аудио. Нови: Genjutsu (смяна на обект/персонаж във видео без пълен реген) и 3D Jutsu (редактируема 3D сцена → видео), плюс MiniMax H3 Max в платформата.

Gemini 3.8 Flash
Най-умният Flash досега за дълъг coding, агенти и enterprise workflow-и. 1M вход, thinking levels, computer use. Introductory цена $0.75 / $3.75 до края на 2026. Има и вариант Flash Cyber за trusted defenders.

Muse Spark 1.3
Meta модел за агентни и coding задачи. По-малко излишни tool call-ове (~20%) и токени (~25%) спрямо 1.2, по-добър на дълги нишки. 1M контекст, $1.25 / $4.25. Наличен в Muse Code и Meta Model API.

GPT-6 Astra
Ново поколение на OpenAI: SOTA на computer use, browsing, coding, math и cybersecurity. 98% FrontierMath T4, 99.9% ARC-AGI-3, 100% ExploitBench. ~1.05M контекст, rollout към Plus/Pro/API.

WeatherNext 3
Глобален AI forecast на DeepMind/Google Research с живи сателитни данни всеки час. До 5 km резолюция, до 50% по-точни валежи, 15-дневни ансамбли. Влиза в Search, Maps, Gemini и Earth Engine.

Fly brain (мъжки Drosophila connectome)
Пълна карта на мозъка и вентралния нервен корд на мъжка плодова муха: 166 000+ неврона и ~125 млн. синапса. Съвместна работа на HHMI Janelia и Google Research — най-големият такъв connectome досега.

Atlas (World Labs)
Omni world model на Fei-Fei Li et al.: текст, образ, видео и 3D в общ пространствен контекст. Camera-controlled видео до 1 мин / 1440p, реконструкция от няколко снимки и real-to-sim. Ще захранва следващия Marble.

Intern Lumina U2
16B-A1B MoE на Shanghai AI Lab с multi-codebook discrete визуално представяне. Един модел за QA, T2I, image/video/3D understanding и editing. Inference кодът е пуснат, теглата предстоят.

Viggle Animate
33.1B fine-tune на MiniMax-H3 ref2va: сменя персонаж във видео от един прерисуван кадър, без pose/mask/prompt. DMD дестилация — 124 кадъра за ~26 сек на B200, около 6× по-бързо от Wan2.2-Animate-14B.

GWM Worlds 2 (Runway)
Интерактивен world model в реално време: 720p @ 24 fps + аудио 48 kHz. Задаваш свят, после го управляваш с текст-действия и камера без фиксирана дължина на сесията. Research preview върху GWM Worlds.
 
  • Like
Реакции: Sky

Горе