Am testat 8 modele folosind exact același prompt.Modelele, în ordine alfabetică: Flux 2 Pro, GPT Image 2, Higgsfield Soul 2, Ideogram 4.0, Krea 2, Midjourney v8.2, Nano Banana Pro, Reve 2.1.
Și o notă despre ceea ce se întâmplă cu textul dumneavoastră între momentul în care îl scrieți și apariția imaginii, deoarece nu este același în toate cazurile. ChatGPT și Nano Banana Pro sunt multimodali, ceea ce înseamnă că există mai mult de un strat între propoziția dumneavoastră și pixelul final: modelul interpretează, expandează și organizează ceea ce ați cerut înainte de a genera imaginea. Acest lucru poate părea un dezavantaj, dar este exact opusul; parte din abilitatea lor de a respecta prompt-ul rezidă tocmai acolo – ei înțeleg intenția reală, în loc să traducă doar cuvintele izolate.
Reve folosește o altă strategie: ajustează prompt-ul în background pentru ca rezultatul să fie mai bun, chiar dacă nu vă arată versiunea finală pe care a folosit-o. Pentru celelalte, am presupus că nu au modificat textul, iar dacă au făcut-o, am evaluat pur și simplu imaginea returnată. La urma urmei, asta e singurul lucru pe care-l văd ca utilizator.
GPT Image 2 citește paragraful ca și cum ar trebui să ți-l explice. Este cel mai obedient la instrucțiuni și cel mai literal cu lumina: ceri o fereastră în stânga și îți oferă o fereastră în stânga, fără niciun fel de discuție. Textura pielii este foarte bună, sursa de lumină cade exact asupra reflexiilor din ochi și nu distorsionează irisul, ceea ce e mai mult decât pot spune jumătate din această categorie. Are doar un singur defect, iar trebuie să mărești imaginea puternic pentru a-l observa: o ușoară textură asemănătoare cu norii în fundal, acel defect pentru care a fost criticat – acel fin țesut care apare uneori și poate strica o imagine altfel impecabilă.
Imagine creată în modelul ChatGPT:

Nano Banana Pro construiește înainte de a renderiza. Este printre cele mai ordonate ca structură și printre cele mai bune la rezolvarea coerenței fizice a unei scene, deoarece punctul său forte este raționamentul privind ceea ce se află în cadru. Cu toate acestea, chiar și cu asemenea calități remarcabile, pielea te dezamăgește. Pigmentația pielii pare algoritmică, ca și cum ar fi un layer Photoshop lipit deasupra, în loc să fie o piele care le prezintă cu adevărat. Iluminarea este corectă, dar imaginea nu prea transmite senzația de realitate, iar o ușoară deformare a irisului parca se vede. Înțelege scena mai bine decât aproape orice alt model și totuși nu reușește să-i conferire un aspect de fotografie.
Imagine creată folosind Nano Banana Pro in Arena.ai

Reve 2.1 Planifică compoziția ca un layout editabil, apoi o redă în rezoluție nativă 4K. Obține rezultate bune: irisul nu se deformează, textura pielii rămâne acceptabilă, iar iluminarea este coerentă. Problema sa este însă alta: la prima vedere trădează că este o imagine generata de IA. Texturile sunt prea regulate și rezultatul prea mediat, acea curățenie netedă, lipsită de imperfecțiuni, face ca ochiul să asocieze imediat imaginea cu una generată artificial. Modelul a fost puțin eclipsat când a apărut Nano Banana Pro, dar încă funcționează foarte bine. De asemenea, merită reținut că, în background, ajustează prompt-ul tău pentru a perfecționa rezultatul, astfel încât regularitatea atent măsurată poate fi, în parte, meritul sau, nu a tau.
Imagine creată gratuit: Reeve AI

Ideogram 4.0 A fost lansat în 2023 ca model tipografic, cel care putea scrie în interiorul imaginii atunci când niciun altul nu reușea să pozeze o literă corect, iar această etichetă a rămas. Însă ultimele sale versiuni se deosebesc prin altceva: hiperrealismul.
Aici oferă o textură a pielii foarte bună, reflexii coerente generate de o singură sursă de lumină în ochi, focalizare corectă și, mai important, fără deformarea irisului. Are două neajunsuri. La apropiere apare un mic pattern care decoloreaza finisajul, ceea ce îl împiedică să semene cu o fotografie reală. De asemenea, modelul prezentază o expresie ușor absentă, ca și cum ar privi fără a fi cu adevărat acolo. Nimic serios, dar suficient pentru a indica că nu este o fotografie.
Imagine creată gratuit:Ideogram 4

Flux 2 Pro A fost revoluționar în vremea sa, în special varianta Kontext care permitea editarea imaginilor folosind instrucțiuni. Însă la acest portret se observă îmbinările. Textura pielii are un efect de porțelan, prea netedă pentru a fi reală; există o ușoară deformare a irisilor, iar ansamblul pare mai mult o pictură realistă decât o fotografie. Se încearcă să se elimine aspectul „artificial” al IA-ului, dar rezultatul e un altul, tot atât de artificial: o pictura hiperrealistă care impresionează din depărtare și se dezintegrează la apropiere. De aceea ocupa ultimul loc, nu pentru că ar fi prost, ci pentru că celelalte au ajuns să semene cat de cat cu o fotografie, în timp ce acesta pare ca o pânză.
Imagine creată în platforma:Replicate Flux Pro

Krea 2 S-a lansat promițând un hiperealism, iar unii l-au comparat cu Nano Banana Pro. În realitate, rezultatul este mai modest. Imaginea vine cu o funcție de netezire a pielii, plus o textură de pori suprapusă care amintește de abuzul la instrumentul „clonare” din Photoshop, iar acest truc face ca punctul focal al privirii să se evidențieze în mod neatural. În plus, există și deformarea irisilor, o problemă pe care multe modele antrenate cu Stable Diffusion o prezintă. Fără îndoială, modelul are personalitate; a fost creat de la zero pentru a evita aspectul tipic AI și tratează prompt-ul mai mult ca o invitație decât ca o comandă. Cu toate acestea, personalitatea nu înseamnă realism, iar aici diferența devine vizibilă.
Imagine creată gratuit:Krea 2

Higgsfield Soul 2, aici cu stilul său implicit, General, provine de la o companie care a crescut semnificativ, în special prin integrarea fluxurilor de lucru video. Iar Soul a reprezentat, la vremea sa, o mică revoluție, dar în sens opus celui la care te-ai aștepta: în locul aspectului campaniei perfect lucrate, a prezentat imagini casuale, care păreau filmate cu un iPhone, depărtându-se astfel de estetica uniformă a celorlalte produse. Acesta este accentul său: fotografia spontană, mai mult decât cea perfectă. Aici tratamentul pielii este cu mult mai bun decât cel al Flux-ului, deși prezintă o ușoară texturare similară celei din Ideogram și comite erori de deformare a irisilor. Autentic în intenție, încă imperfect în execuție.
Imagine creată în Higgsfield gratuit:

Castigatorul – Midjourney 8.2
Rămân de explicat două imagini, ambele provenind din același model: Midjourney 8.2.
De ce apare Midjourney de două ori
Același text, același raport de aspect, aceeași versiune, același zi. Singura lucru care se schimbă între ele este parametrul tail, iar exact acolo se află totul.
Imagini create în:Midjourney

Prompt: A close-up portrait of a young woman with dark hair looking directly into the camera, lit by soft natural light coming from a window on her left, standing against a plain neutral grey background, shallow depth of field, shot on an 85mm lens — ar 16:9 — v 8.2

Prompt: A close-up portrait of a young woman with dark hair looking directly into the camera, lit by soft natural light coming from a window on her left, standing against a plain neutral grey background, shallow depth of field, shot on an 85mm lens — ar 16:9 — profile igswzx5 — stylize 650 — v 8.2
Priviți-le împreună. Și observați prima imagine de sus, separat, pentru că este printre cele mai bune din test: textura pielii foarte bună, lumină coerentă în ochi, fără niciun tipar de fundal și doar un mic defect care apare în unele rulaje, o ușoară deformare a irisului. Midjourney v8.2 tocmai a fost lansat și deja începe cu un realism extrem de ridicat, chiar înainte de a aplica orice ajustare.
La a doua imagine, locul unde se află diferența. –profile igswzx5 este piesa cheie și cea pe care niciun alt model nu o replică în același mod. Este un profil de personalizare, un stil pe care Midjourney l-a învățat dintr-un set de imagini pe care le alegi și le evaluezi. Nu este un filtru sau un preset generic: este criteriul tău estetic transformat într-un cod pe care îl poți introduce la finalul oricărui prompt. În ceea ce privește opțiunea –stylize 650, aceasta reprezintă gradul de stilizare aplicat imaginii.
Cel mai onest comparativ din întregul experiment nu este între Midjourney și celelalte șapte. Este între Midjourney și sine însuși: modelul de bază, deja excelent, versus modelul adaptat după gustul tău folosind doar doi parametri.
Dacă știi cum să folosești un instrument, vei descoperi întregul său potențial estetic. Deoarece, dacă tu nu alegi stilul, cineva altcineva deja l-a ales pentru tine.
Parametri vs. Înțelegere
Până acum, Midjourney pare să fi ieșit întărit, însă o comparație serioasă trebuie să ia în calcul și aspectele pe care abordarea sa nu le rezolvă. Există un domeniu în care arhitectura sa rămâne sub nivelul așteptat.
Midjourney nu raționează în funcție de ceea ce îi arăți. Îi furnizezi o referință prin opțiunea –sref și un grad de influență prin –sw, dar nu îi ceri să înțeleagă acea fotografie, ci să se apropie de acel stil cu o anumită intensitate. Este „nevăzător” în ceea ce privește conținutul și tocmai de aceea rezultatele sale sunt repetabile: același set de parametri va produce același rezultat atât azi, cât și peste trei luni. GPT Image 2 și Nano Banana Pro fac exact opusul: citesc referința, înțeleg că lumina intră din stânga și generează pornind de la această informație. Aici nu există niciun număr de ajustat, ci doar limbaj.
Iar diviziunea nu este binară, ci are trei niveluri:
1. Multimodal deplin dezvoltat, care raționează atât asupra textului, cât și a imaginii: GPT Image 2 și Nano Banana Pro.
2. Hibrizi care analizează ceea ce le arătați, dar desenează folosind difuzia: Flux 2 Pro și Reve 2.1.
3. Difuzia pură, în care referința este stilul, niciodată conținutul: Krea 2, Ideogram 4.0, Higgsfield Soul 2, precum și Midjourney însuși.
O setare este documentată și repetată. O interpretare reușește din prima încercare și nu poate fi copiată. Precizie versus înțelegere – alegeți în funcție de sarcină, nu din „loialitate”.
Și iată partea sinceră, cea care nu vă va plăcea dacă sunteți în tabăra Midjourney: când vine vorba de respectarea prompt-ului, Midjourney pierde. Îi ceri ceva specific și adesea interpretează ce vrea el, în timp ce un model multimodal precum GPT Image 2 sau Nano Banana Pro citește propoziția, o înțelege și vă oferă exact ce ați cerut.
Midjourney ocupă primul loc în clasamentul meu deoarece produce cea mai credibilă textură a pielii din întreaga grupare; însă, dacă aveți nevoie de o reprezentare precisă și fidelă a unei scene complexe, cu mai multe obiecte și relații între acestea, atunci modelele multimodale îl depășesc, iar niciun parametru nu poate compensa această lipsă. Acestea câștigă la capitolul înțelegere ceea ce Midjourney câștigă în textură. Aceasta este limita experimentului, iar oricine ignoră această realitate va sfârși prin a folosi un instrument nepotrivit.
Iar acea precizie a texturii explică cea mai bună imagine a experimentului: Midjourney cu –profile, pe care ați și văzut-o deja. Modelul de bază este deja realist, dar adăugarea unui profil antrenat pe propriile referințe ridică ștacheta calității cu o treaptă întreagă, oferind o piele excelentă, fără nicio deformare a irisului și cu o lumină coerentă. Nu este doar un moft personal: impactul stilurilor a fost atât de mare încât OpenAI și Google își adaugă propriile opțiuni de selecție. Ceea ce Midjourney a transformat într-o metodă, ceilalți o copiază ca simplă funcționalitate.
Clasamentul final
Și un clasament, de la cel mai bun la cel mai slab, după privirea fiecărei imagini din apropiere, inclusiv irisul:
- Midjourney v8.2 with a personalization profile. În afara competiției prin pura putere. Realism ridicat la bază și, cu un profil format pe propriile referințe plus o stilizare accentuată, textură excelentă a pielii, niciun iris deformat, lumină coerentă. Parametrii sunt zidurile sale defensive.
- GPT Image 2Foarte bună piele, lumină precisă în ochi, fără deformații ale iridei. Doar ușoara structură cu pete de nori, observată la o examinare atentă, îl împiedică să fie perfect.
- Midjourney v8.2, plain. Chiar de-abia apărut și deja cu o piele foarte bună și o lumină coerentă, fără niciun tipar de fundal. O ușoară deformare a irisului în unele rulaje este singura sa limitare.
- Ideogram 4.0. Cea mai mare surpriză. Unul dintre cele mai realiste realism, piele bună, reflexii coerente, niciun iris deformat. Pierde doar la un modelaj fin din apropiere și la o expresie ușor lipsită de intensitate.
- Reve 2.1.Bune rezultate, irisul intact, pielea acceptabilă, lumină coerentă. Cu toate acestea, se trădează ca AI prin texturile sale regulate și prea mediate.
- Nano Banana ProGenerează foarte bine și înțelege scena ca puțini alți artiști, însă textura pielii nu este la înălțime: petele de vânt pe care le produce par algoritmice, iar o ușoară deformare a irisului îi distrug realismul.
- Krea 2. Promite hiperrealism și se mulțumește cu o piele editată prin Photoshop, cu pori artificiali și deformarea irisului, un moștenire a linia sa de la Stable Diffusion. Multă personalitate, puțin realism.
- Higgsfield Soul 2. Egal cu Krea în evaluarea mea. Charm-ul său constă într-o estetică casual de tip iPhone, iar aplicația sa este mai bună decât cea a lui Flux, însă prezintă probleme cu texturile și erori la iris.
- Flux 2 ProArena.ai(în mod gratuit) Închide clasamentul. Ten de porțelan, o iris ușor deformat și un final care seamănă mai mult cu o pictură realistă decât cu o fotografie. Revoluționar în vremea sa, acum depășit din punct de vedere al realismului.