![]()
2026 m. rugpjūčio 11 d. NVIDIA pristatė „Nemotron 3.5 Lightning“ – atvirą dirbtinio intelekto modelį, optimizuotą greitam didelės apimties užduočių vykdymui ilgai veikiantiems DI agentams.
Tai mažiausias „Nemotron 3“ šeimos modelis. Jis turi 30 mlrd. parametrų, tačiau generuojant kiekvieną žetoną skaičiavimuose naudojama tik apie 3 mlrd. aktyvių parametrų. Kartu NVIDIA pristatė ir atvirojo kodo modelių maršrutizavimo biblioteką „NeMo Switchyard“.
Modelis naudoja hibridinę architektūrą, kurioje derinami „Mamba-2“, mišraus ekspertų modelio (MoE) ir atskiri dėmesio mechanizmo sluoksniai. Tokia struktūra leidžia išlaikyti didesnio modelio pajėgumą, tačiau kiekvienos užklausos metu naudoti tik dalį visų parametrų.
Kam skirtas „Nemotron 3.5 Lightning“?
Ilgai veikiantys DI agentai didelę darbo dalį skiria ne sudėtingam planavimui, bet dažnai pasikartojančioms operacijoms: įrankių iškvietimams, gautų rezultatų tikrinimui, duomenų formatavimui ir užduočių perdavimui kitiems agentams.
Jeigu kiekvienas toks veiksmas perduodamas dideliam pažangiam modeliui, didėja skaičiavimo sąnaudos, atsakymo laikas ir visos užduoties kaina. „Nemotron 3.5 Lightning“ skirtas šiam vykdymo sluoksniui, o sudėtingesnis planavimas gali būti perduodamas didesniems modeliams, pavyzdžiui, „Nemotron 3 Ultra“.
Toks principas vadinamas modelių sistema: skirtingo dydžio ir paskirties modeliai dirba kartu, o kiekviena užduotis nukreipiama tinkamiausiam modeliui. Tam skirta ir „NeMo Switchyard“ biblioteka – ji leidžia kurti maršrutizavimo sistemą, kuri pagal užduoties sudėtingumą, kainą, delsą ar kokybės reikalavimus parenka atvirą arba uždarą modelį.
Kaip pasiektas didesnis greitis?
„Nemotron 3.5 Lightning“ buvo mokomas naudoti kelių žetonų prognozavimą, kuris gali būti pritaikytas spekuliatyviajam dekodavimui. Taikant šį metodą iš anksto pasiūlomi keli galimi žetonai, kuriuos pagrindinis modelis patikrina efektyviau nei generuodamas kiekvieną žetoną atskirai.
NVIDIA taip pat išleido du specializuotus juodraštinius modelius: „DSpark“, skirtą „DGX Spark“ ir duomenų centrų aplinkoms, kuriose vienu metu apdorojamas nedidelis užklausų skaičius, bei „DFlash“, optimizuotą mažos delsos darbui galingose vietinėse sistemose ir duomenų centruose.
Pateikiamos BF16 ir našesniam vykdymui optimizuotos NVFP4 modelio versijos. NVFP4 leidžia sumažinti atminties ir skaičiavimo poreikius, tačiau realus greitis priklausys nuo naudojamos aparatinės įrangos, programinės įrangos ir užklausų skaičiaus.
NVIDIA skelbia, kad modelis gali generuoti išvestį iki keturių kartų greičiau už panašaus dydžio atvirus modelius. „PinchBench“ teste „Nemotron 3.5 Lightning“ pasiekė 86 proc. tikslumo rodiklį ir 10 000 užduočių atliko 30 proc. greičiau už panašaus tikslumo „Qwen“ 35B klasės modelį.
Šiuos skaičius reikėtų vertinti atsargiai, nes juos paskelbė pati NVIDIA. Be to, bendrovės techniniame tinklaraštyje konkurento modelis įvardytas kaip „Qwen3.6 35B“, o oficialioje „Nemotron“ modelio kortelėje pateikiamas „Qwen3.5-35B-A3B“. Todėl tikslus palyginimo pagrindas kol kas nėra visiškai aiškus.
Atvira licencija ir pritaikymo galimybės
„Nemotron 3.5 Lightning“ platinamas pagal leidžiamąją „OpenMDW-1.1“ licenciją. Ji leidžia modelį naudoti komerciniuose projektuose, modifikuoti ir platinti, tačiau platinant modelio medžiagą reikia išsaugoti licencijos tekstą, autorių teisių ir kilmės pranešimus.
NVIDIA kartu su modelio svoriais skelbia mokymo receptus ir dalį naudotų duomenų rinkinių. Vis dėlto pati bendrovė pažymi, kad mokymo duomenys ir metodai publikuojami tiek, kiek tai leidžia jų licencijos. Todėl nederėtų teigti, kad visas pradinis mokymo korpusas yra visiškai atviras.
Modelį galima papildomai mokyti konkrečios įmonės duomenimis, taikyti SFT ar sustiprinamąjį mokymą ir kurti savas kvantuotas versijas.
Kur galima paleisti modelį?
Modelis gali būti diegiamas vietiniuose kompiuteriuose, darbo stotyse, duomenų centruose arba debesijos infrastruktūroje. NVIDIA nurodo, kad optimizuotos jo versijos gali veikti tokiose sistemose kaip „GeForce RTX 5090“ kompiuteriai, „DGX Spark“ ir „DGX Station“, suderinami „Jetson“ įrenginiai bei duomenų centrų NVIDIA GPU infrastruktūra.
Modelį palaiko „LM Studio“, „llama.cpp“, „Ollama“, „Unsloth“, „vLLM“ ir kiti DI modelių vykdymo įrankiai. Jį taip pat galima išbandyti per „NVIDIA Build“, „OpenRouter“, o svorius atsisiųsti iš „Hugging Face“ ir „ModelScope“.
Nors optimizuotą modelio versiją galima paleisti vienoje galingoje vietinėje sistemoje, praktiniai atminties ir našumo reikalavimai priklausys nuo pasirinkto kontrolinio taško, konteksto ilgio ir naudojamos programinės įrangos.
Ką tai reiškia vartotojams ir verslui?
Atviras modelis suteikia įmonėms ir kūrėjams daugiau pasirinkimo, kur laikyti ir apdoroti duomenis. Jį galima diegti nuosavoje infrastruktūroje arba pasirinktame duomenų centre, užuot visas užklausas automatiškai siuntus išorinio DI paslaugų teikėjo API.
Tai gali būti aktualu organizacijoms, kurioms svarbus duomenų suverenumas, komercinių paslapčių apsauga ir galimybė kontroliuoti techninę infrastruktūrą. Tačiau vietinis modelio paleidimas savaime neužtikrina atitikties tokiems reguliavimams kaip BDAR ar ES dirbtinio intelekto aktas – įmonė vis tiek turi atskirai įvertinti duomenų tvarkymo pagrindą, saugumą, modelio paskirtį, rizikos kategoriją ir žmogaus priežiūros reikalavimus.
Modelio kortelėje nurodoma, kad jo pradinio mokymo duomenys apima anglų ir dar 19 natūraliųjų kalbų, tačiau visas jų sąrašas nepateikiamas. Todėl remiantis šiuo metu paskelbta informacija negalima patvirtinti, kuriomis konkrečiai kalbomis modelis buvo mokytas, ir patikimai įvertinti jo gebėjimų dirbti ne angliškai.
Paprastam vartotojui šis modelis dažniausiai bus naudingas netiesiogiai – per produktus ir agentus, kurie jį naudoja „po gaubtu“. Greitesnis ir pigesnis vykdymo sluoksnis reiškia, kad DI agentai gali dirbti sparčiau ir pigiau, o tai gali atsispindėti paslaugų kainose ar atsako greityje. „Nemotron 3.5 Lightning“ nėra skirtas pakeisti didžiausius samprotavimo modelius – jo stiprybė yra greitai ir palyginti pigiai vykdyti daug pasikartojančių agento veiksmų, o sudėtingesnes užduotis perduoti pajėgesniam modeliui.
Šaltiniai: NVIDIA Technical Blog, NVIDIA Blog, oficiali modelio kortelė, OpenMDW-1.1 licencija.