Modele locale de IA explicate pentru cazurile de utilizare în cybersecurity

de | august 6, 2026

Există zeci de modele open weights pe care le poți descărca în 2026. Nu este nevoie să le cunoști pe toate. Ai nevoie să cunoști doar câteva dintre ele, cele care sunt cu adevărat bune, bine susținute și practice pentru munca de cybersecurity pe hardware real.

Iată modelele care merită atenția dumneavoastră în acest an. Fiecare folosește același format, astfel încât să le puteți compara echitabil. O scurtă mențiune despre doi termeni recurenti:

  • Open-weights înseamnă că poți descărca fișierul modelului și să-l rulzi singur. (Nu este întotdeauna în întregime „open source” din punct de vedere legal, dar poți să-l găzduiești pe serverul tău, ceea ce contează pentru acest ghid.)
  • Quantizarea înseamnă înghețarea unui model astfel încât să folosească mai puțină memorie, stocând greutatile sale cu o precizie mai mică. Un model „quantizat la 4 biți” este mult mai compact și mai rapid, cu o ușoară scădere a calității. Formatul de fișier popular pentru acest lucru în rulările locale este GGUF. Când spunem că un model de 8 B „încapă în 8 GB”, presupunem o quantificare rațională.

Ratingul de beginner friendly din fiecare card reprezintă scorul nostru de la 1 la 10 privind cât de ușor este pentru un începător să pună în funcțiune acest model și să obțină rezultate bune pe hardware tipic — nu este o măsură a inteligenței brute.

Inteligența artificială locală s-a dezvoltat rapid la începutul anului 2026. Două lansări au schimbat situația. Qwen3.6-27B (22 aprilie 2026) este un model dens de codare cu 27 de miliarde de parametri, care obține o scor de 77,2% la SWE-bench Verified — depășind chiar și predecesorul său de 397 de miliarde de parametri — și poate fi rulat pe un singur GPU de 24 GB.

În plus, Gemma 4 (31 martie 2026) a adus o familie nouă, complet multimodală, cu dimensiuni variind de la cele foarte mici, adecvate pentru dispozitivele de frontieră, până la un model de 31 de miliarde de parametri.

Familia Qwen3.6 (Alibaba) — Modelul anului 2026

Scurtă privire de ansamblu: Qwen3.6 este modelul care a făcut posibilă aplicarea practică a unor soluții serioase de securitate locală. Modelul principal, cu 27 de miliarde de parametri, este un model dens (toți cei 27 de miliarde de parametri sunt activi), capabil să concureze la nivelul modelelor de vârf disponibile în cloud pentru sarcini de programare și agentic, fiind totodată optimizat pentru a funcționa pe o singură placa grafică de 24 GB. Familia include, de asemenea, un model MoE rapid de 35 de miliarde de parametri (A3B), cu un volum total de 35 de miliarde, dar doar aproximativ 3 miliarde active la fiecare token, ceea ce îl face extrem de rapid, precum și un model ușor, de 9 miliarde de parametri, destinat hardware-ului mai slab. Licențiat sub Apache 2.0, acest model este multimodal (cu abilitatea de a procesa imagini) și oferă atât moduri de reasoning cât și moduri non-reasoning într-un singur punct de control.

  • Puncte forte: Cel mai bun raport calitate-mărime disponibil la nivel local; versiunea de 27B obține un scor de 77,2% conform SWE-bench Verified și egalează un model de top bazat pe cloud (Claude Opus 4.5) pe Terminal-Bench 2.0 cu un scor de 59,3%; apeluri de instrumente excelente și fiabile — ceea ce înseamnă direct mai puține erori de tip „modelul a chemat funcția greșit” în buclele agentului n8n; rezultate structurate (JSON) solide; MoE-ul de 35B-A3B rulează la aproximativ 180 de tokeni/secundă pentru sarcini cu debit ridicat; licență Apache 2.0.
  • Puncte slabe: Calitatea contextelor lungi se degradează după aproximativ 32K de tokeni pe hardware de uz casnic, în ciuda unei limite teoretice mai mari; modelul dens de 27B este mai lent (~70 t/s pe un RTX 5090) decât cel MoE; totuși rămâne în urmă față de cele mai bune modele cloud la cele mai dificile cazuri de depistare a erorilor în mai multe pași.
  • Cele mai bune cazuri de utilizare în cybersecurity: Noul motor principal standard — triajul alertelor, extragerea IOC-urilor, analiza logurilor, redactarea rapoartelor, detecția sub formă de cod și automatizarea agentică a SOC-ului acolo unde apelurile la unelte fiabile sunt esențiale. Folosiți 35B-A3B pentru triajul critic din punct de vedere al vitezei și cu volum mare.
  • Hardware recomandat: 9B → 8 GB+; 35B-A3B MoE → 16 GB+ (consum redus datorită activării de doar 3B); 27B dens → 18 GB+ (o singură RTX 4090/5090 sau un Mac cu 24 GB).
  • Rating prietenos pentru începători: 9/10 — un singur pull Ollama, furnizor oficial compatibil cu OpenClaw și n8n, potrivit pentru o singură unitate grafică modernă.

Familia Qwen3.5 (Alibaba) — Specialistul Generalist

Scurtă privire de ansamblu: Qwen3.5 este familia multimodală extinsă care a apărut imediat înainte de versiunea 3.6, cuprinzând modele de la foarte mici la foarte mari: 0,8B, 2B, 4B, 9B, 27B, 35B și un model impresionant de 122B. Este verificată prin numeroase teste, este susținută pe toate platformele și reprezintă o opțiune excelentă atunci când doriți să aveți acces la cele mai variate dimensiuni sau la un model stabiliat și bine încercat.

  • Puncte forte: Gama imensă de dimensiuni, astfel încât să potrivești orice hardware; funcționalitate multimodală (vizuală) și utilizarea uneltelor pe toată linia; testat extrem de extins, cu numeroase tutoriale și optimizări; excelent pentru standardizarea unei familii de modele pe o flotă de sisteme mixte.
  • Puncte slabe: Pe benchmarkurile pure de codare/agenție, noua generație 3.6 îi ia înaintea modelelor comparabile ca mărime; există atât de multe variante încât începătorii se confruntă cu paralizia alegerii.
  • Cele mai bune cazuri de utilizare în cybersecurity: automatizarea generală a SOC pe diverse sisteme hardware, analiza în mai multe limbi a conținutului de phishing și amenințări, un „model standard” stabil atunci când doriți o singură familie peste tot.
  • Hardware recomandat: 0,8–4B → 8 GB; 9B → 8–12 GB; 27B → 18–24 GB; 35B MoE → 16 GB+; 122B → multi-GPU/memorie unitară mare.
  • Rating prietenos pentru începători: 8/10 — testat și flexibil; alege doar o mărime și pornește.

Gemma 4 Family (Google) — Eficientă și complet multimodală

Scurtă privire de ansamblu: Gemma 4 (lanțat pe 31 martie 2026) este familia deschisă perfecționată a Google, concepută pentru a oferi „performanțe la nivel de frontieră la fiecare dimensiune”. Dimensiuni: E2B și E4B (la limită; litera „E” reprezintă parametrii eficienți), 12B (o versiune multimodală unificată fără codificator), 26B-A4B (un MoE cu debit ridicat și aproximativ 4 miliarde de unități active), precum și o variantă densă de 31B. Suport text + imagine la toate modelele; video și audio native în cazul modelelor E2B, E4B și 12B.

  • Puncte forte: Performanță excelentă raportată la gigabyte; modelul de 31B combină calitatea serverelor cu execuția locală pe un singur GPU; este cu adevărat multimodal (poate analiza capturi de ecran cu phishing, imagini ale documentelor, chiar și audio/video, chiar și în cazul modelelor mai mici); modelele E2B/E4B pentru margini sunt excelente pentru laptopurile izolate și kit-urile de teren; rezultate curate, bine structurate și axate pe respectarea vieții private; acoperire largă a limbilor.
  • Puncte slabe: Utilizează licența Gemma a Google (permisivă, dar nu Apache); cele mai noi variante sunt încă noi, deci unele instrumente și procese de quantificare sunt în curs de perfecționare; extensiile multimodale necesită puțin efort de configurare.
  • Cele mai bune cazuri de utilizare în cybersecurity: implementări SOC cu un singur GPU (31B), analiză multimodală a phishing-ului/documentelor, configurații ușoare centrate pe confidențialitate și kit-uri la nivel de frontieră sau izolate (clasele E2B/E4B/8B), triaj cu debit ridicat (MoE 26B-A4B).
  • Hardware recomandat: E2B → CPU/8 GB; E4B/8B-class → 8 GB+; 12B → 16 GB+; 26B-A4B MoE → 16–24 GB (ușor, ~4B activ); 31B dens → 24 GB GPU.
  • Rating pentru începători: 8/10 — eficient și fiabil; opțiunile multimodale adaugă o ușoară complexitate.

gpt-oss (OpenAI Open Weights)

Scurtă privire de ansamblu: Versiunea cu greutăți deschise a OpenAI este disponibilă în variante de 20 de miliarde și 120 de miliarde de parametri, sub licența Apache 2.0, fiind orientată spre raționament puternic și utilizare agentică, cu un context window de 128K. Modelul de 20 de miliarde este foarte performant chiar și pe un singur sistem cu memorie video de 16 GB; modelul de 120 de miliarde (un MoE) este destinat echipamentelor hardware de înaltă performanță.

  • Puncte forte: Raționament structurat puternic și utilizare eficientă a instrumentelor; licență permissivă Apache 2.0; context de 128K; modelul de 20B atinge un raport excelent între capacități și hardware; urmarea instrucțiunilor predictibilă și corectă.
  • Puncte slabe: Doar două dimensiuni, deci potrivirea hardware-ului este mai puțin fină decât la Qwen; versiunea de 120B necesită aproximativ 80 GB; pe benchmarkurile brute de codare din 2026, acum rămâne în urma lui Qwen3.6 la dimensiuni similare utilizabile.
  • Cele mai bune cazuri de utilizare în cybersecurity: triaj și analiză a incidentelor bazate pe raționament intensiv, explicarea logicii de detecție, analiză atentă pas cu pas sub o licență curată.
  • Hardware recomandat: 20 GB → 16 GB; 120 GB → ~80 GB VRAM.
  • Rating prietenos pentru începători: 8/10 — ușor de condus, în special modelul 20B.

Llama 3.3 70B (Meta) — Light Open Weights

Scurtă privire de ansamblu: Linia Llama a Meta rămâne familia cea mai larg susținută din ecosistem. Modelul dens de 70 de miliarde de parametri este „greutatea grea” practică a anului 2026: puternic în programare generală și excelent la urmărirea instrucțiunilor, fiind acum cu adevărat executabil datorită sistemelor cu două unități grafice și laptopurilor Apple cu memorie unificată de 128 GB.

  • Puncte forte: Ecosistem masiv și suport puternic pentru instrumente (dacă un instrument rulează orice model, rulează și Llama); raționament general de încredere și urmărirea instrucțiunilor; excelent ca model mare stabil și bine înțeles; funcționează pe un desktop cu două procesoare 5090 sau pe un laptop M5 Max cu 128 GB memorie.
  • Puncte slabe: Licența comunitară are condiții de utilizare pe care marii operatori ar trebui să le citească; 70B este foarte solicitant la nivel de hardware (dual GPU sau memorie unificată de înaltă performanță) și mai lent (~27 t/s pe un dual RTX 5090, ~18–25 t/s pe M5 Max); modele specializate mai noi îl depășesc în ceea ce privește codarea pură.
  • Cele mai bune cazuri de utilizare în cybersecurity: asistent general pentru SOC, analiză a documentelor lungi sau a incidentelor, medii care pun accent pe compatibilitate maximă și un model verificat.
  • Hardware recomandat: 70B (Q4) → două RTX 5090 (~64 GB în total) sau M5 Max cu 128 GB memorie unificată.
  • Rating pentru începători: 7/10 — extrem de bine documentat, dar versiunea robustă necesită hardware real.

Familia Mistral (Mistral AI) — Devstral, Ministral și Mistral Medium

Scurtă privire de ansamblu: modelele Mistral reprezintă modele curate și eficiente pe întregul spectru de mărime. Devstral Small 2 (24B) se distinge prin codare agentică — explorarea bazei de cod și editarea mai multor fișiere. Ministral 3 (3B/8B/14B) este conceput pentru implementarea la limită. Mistral Medium 3.5 (128B) este nava amiral, combinând urmărirea instrucțiunilor, raționamentul și codarea.

  • Puncte forte: Codificare puternică bazată pe agenție/utilizare a uneltelor (Devstral); opțiuni eficiente la limită (Ministral 3 funcționează pe hardware modest); multimodal pe o mare parte din gamă; proveniența europeană poate simplifica unele discuții legate de guvernanța datelor.
  • Puncte slabe: Devstral este specializat în codare și este excesiv pentru sarcini simple de text; Mistral Medium 3.5 (128B) necesită hardware puternic; comunitatea sa este mai mică decât cea a Qwen/Llama.
  • Cele mai bune cazuri de utilizare în cybersecurity: detecția sub formă de cod (Sigma/YARA/KQL), automatizarea care editează script-uri în mai multe fișiere, execuția agentică a playbook-urilor, implementări la nivel de frontieră sau cu resurse limitate (Ministral 3).
  • Hardware recomandat: Ministral 3 → 8–16 GB; Devstral Small 2 (24B) → 24 GB GPU; Mistral Medium 3.5 (128B) → multi-GPU/mare memorie unificată.
  • Rating pentru începători: 7/10 — modele excelente; punctele cheie ale agenței și codurilor implică mai multe componente mobile.

DeepSeek-V4 (DeepSeek AI) — MoE de frontieră

Scurtă privire de ansamblu: Linia V4 a DeepSeek reprezintă avangarda modelelor cu greutăți deschise. V4-Flash este un model bazat pe tehnologia Mixture-of-Experts, cu o capacitate totală de 284 de miliarde de parametri și aproximativ 13 miliarde de parametri activi, precum și un context de 1 milion de tokeni; V4-Pro este flagship-ul mai mare, dotat cu mai multe moduri de raționament. Modele de înaltă performanță pentru situațiile în care sarcina îi impune cu adevărat.

  • Puncte forte: raționament și codare la nivel de frontieră; context enorm de 1 milion de token pentru analiza întregii baze de cod sau a întregului incident; design eficient MoE (doar aproximativ 13 miliarde din 284 miliarde sunt active pe Flash); moduri puternice de agenție și gândire.
  • Puncte slabe: Are nevoie de servere cu mai multe unități GPU sau de unități GPU de calitate cloud (adesea funcționează ca o construcție găzduită/în cloud, chiar și în biblioteca Ollama); excesiv și peste buget pentru sarcinile curente de text ale SOC; complexitate operațională reală.
  • Cele mai bune cazuri de utilizare în cybersecurity: cercetare profundă, analiză la scară largă a codului și a vulnerabilităților în întregi repositoare, raționamentul cel mai complex în mai multe etape — atunci când dispui de echipamentul necesar.
  • Hardware recomandat: servere cu mai multe unități GPU sau infrastructură GPU privată/în cloud.
  • Rating pentru începători: 4/10 — puternic, dar un proiect de infrastructură, nu ceva de tipul „descarc și folosesc”.

Valul Nou al Modelor de Codare Agentică (2026)

Scena codării/agenților a explodat în 2026, iar numeroase lansări folosesc arhitecturi de tip Mixture-of-Experts (MoE) — cu o dimensiune totală mare, dar o dimensiune activă mică — pentru a oferi capacități agențiale puternice pe hardware destinat utilizatorilor finali. Dacă munca dvs. de securitate se axează pe detecția bazată pe cod și pe ingineria agențială, acestea merită cunoscute:

  • Codul Mini Nord 1.0 (Cohere) — 30B MoE / 3B activ: conceput special pentru ingineria agentică a software-ului — modificări în repo, sarcini de terminal, verificare de cod. Eficient și rapid.
  • Nemotron Cascade 2 (NVIDIA) — 30B MoE / 3B activ: raționament puternic și capacitate de agenție/depanare, eficient pe GPU-uri destinate utilizatorilor casnici.
  • GLM-4.7-Flash / GLM-5.x (Z.ai): GLM-4.7-Flash se remarcă în clasa de 30 de miliarde de parametri pentru implementarea ușoară și agentică; familia mai mare GLM-5.x se îndreaptă către proiecte de lungă durată, de nivel de flagship (în principal pentru cloud).
  • Granit 4.1 (IBM) — 3B/8B/30B, Apache 2.0: pregătit pentru mediul de business, cu utilizarea de înaltă calitate a instrumentelor și un output JSON structurat — o licență clară și extrem de potrivit pentru companii preocupate de conformitate.
  • LFM2.5 / Ministral 3 / Laguna XS.2: modele eficiente bazate pe frontieră și pe dispozitiv (adesea de aproximativ 1–8 miliarde de parametri, sau 30 de miliarde în cazul unui MoE cu aproximativ 3 miliarde activi) pentru apeluri rapide și sigure ale instrumentelor pe laptopuri și pe hardware cu resurse limitate.
  • Variantele Qwen3-Coder și qwen3.5 Coder: versiuni dedicate pentru codare cu context lung, atunci când doriți un model Qwen optimizat special pentru codare.

Pentru cei mai mulți cititori, acestea sunt funcții suplimentare opționale. Începeți cu Qwen3.6 sau Gemma 4 pentru automatizarea generală a securității și apelați la un model dedicat programării doar atunci când construiți serios procese de detecție bazate pe cod sau sisteme agențiale.

Matrice de comparare a modelelor

ModelLicențăCel mai bun pentruHardwareRating pentru beginner user friendly
Qwen3.6 27B (dens) 27BApache 2.0Calitate de top în ceea ce privește mărimea, SOC agentic (77,2% SWE-bench)18 – 24 GB9/10
Qwen3.6 35B-A3B (MoE) 35B / 3B activApache 2.0Triaj critic în ceea ce privește viteza, cu volum mare (~180 t/s)16 GB+9/10
Qwen3.6 9B (dens)9BApache 2.0Dispozitive de intrare, sarcini simple, rapiditate8 GB+9/10
Familia Qwen3.5 0,8B–122BApache 2.0Generalistul verificat pe scară largăorice hardware 8 GB – multi-GPU8/10
Gemma 4E2B, E4B, 12B, 26B-A4B, 31BTermeni GemmaGPU unic, SOC, multimodal, la margine8 GB – 24 GB8/10
gpt-oss20B, 120BApache 2.0Triaj/IR cu accent pe raționament16 GB – 80 GB8/10
Lama 3.3 70B70BComunitatea LlamaGreutate grea generală de încredereGPU dublă / 128 GB unitar7/10
Devstral Mic 224BApache 2.0Detecție ca cod, modificări agențiale24 GB7/10
Ministral 3 / Granit 4.13B–30Apache 2.0 (Granit)Apelarea instrumentelor la frontieră, JSON, conformitate8 GB – 24 GB8/10
Codul Mini Nord / Nemotron Cascade 230B / 3B activ (MoE)Greutatea deschisăCodificare agentică, modificări ale repo-ului, eficient16 – 24 GB7/10
DeepSeek-V4 Flash284B / 13B activCercetare MITFrontier1M de context, întreaga repoMulti-GPU / cloud4/10