Sari la conținut
Generarea de imagini cu AI: cum formulezi descrierea ca să obții ce ai în minte
Foto: Ivan Chumak / Pexels
Inteligență artificială

Generarea de imagini cu AI: cum formulezi descrierea ca să obții ce ai în minte

Prima experiență cu un generator de imagini seamănă aproape întotdeauna cu o mică dezamăgire. Ai în cap o imagine limpede, scrii ce vrei, apeși butonul — și primești ceva care are legătură cu descrierea ta, dar nu e nici pe departe ce vedeai. Reacția firească e să crezi că instrumentul e slab. De obicei, problema e alta: descrierea a fost mult mai vagă decât părea.

Modelul nu îți citește intenția. Nu știe că atunci când ai scris „o cafenea frumoasă” te gândeai la o cafenea anume, din Cluj, într-o dimineață de octombrie. El completează golurile cu media a tot ce a văzut în timpul antrenamentului, iar media e generică prin definiție.

Cele cinci lucruri pe care o descriere bună le conține

Practic, orice descriere care funcționează răspunde la aceleași întrebări. Nu într-o ordine sacră și nu obligatoriu pe toate, dar cu cât lipsesc mai multe, cu atât modelul improvizează mai mult.

  • Subiectul — cine sau ce, cu detalii concrete: vârstă aproximativă, îmbrăcăminte, poziție, expresie.
  • Acțiunea — ce face, în acest moment. Un verb schimbă complet compoziția.
  • Mediul — unde se află și ce se vede în jur, inclusiv în plan îndepărtat.
  • Lumina — probabil cel mai subestimat element. Lumină de dimineață prin fereastră, contra-lumină, neon, zi înnorată — fiecare dă o imagine radical diferită.
  • Stilul și încadrarea — fotografie, ilustrație, acuarelă, randare 3D; prim-plan, plan american, unghi de jos.

Compară „un bărbat care lucrează la birou” cu „un bărbat de vreo 50 de ani, cu cămașă albastră cu mânecile suflecate, aplecat peste niște planuri desfășurate pe un birou de lemn, lumină caldă de la o veioză, restul camerei în penumbră, fotografie, plan mediu, adâncime mică de câmp”. A doua descriere nu e mai artistică. E doar mai puțin ambiguă.

Cum lucrează modelul cu cuvintele tale

Există câteva mecanisme utile de știut, pentru că explică frustrări frecvente.

Ordinea contează. Cuvintele de la începutul descrierii au, în general, mai multă influență decât cele de la final. Dacă un element e esențial, nu-l lăsa în coadă.

Negațiile funcționează prost. „Fără mașini pe stradă” conține cuvântul „mașini”, iar modelul reacționează la el. Multe sisteme au un câmp separat de excludere, iar acolo negația chiar funcționează; în descrierea principală, e mai eficient să spui ce vrei să fie, nu ce nu vrei.

Textul în imagine rămâne slab, mai ales în română. Cuvintele cu diacritice apar frecvent deformate. Dacă ai nevoie de text lizibil pe un afiș, varianta rezonabilă e să generezi fundalul și să adaugi textul separat, într-un editor.

Iar numărul exact de obiecte sau de persoane e o zonă în care modelele greșesc constant. „Cinci mere pe o masă” poate produce patru sau șapte. Cu cât cifra e mai mare, cu atât probabilitatea scade.

Metoda care economisește cel mai mult timp

Cea mai bună abordare nu e să scrii o descriere perfectă din prima, ci să pornești de la una simplă și să o rafinezi în trepte.

Începi cu douăzeci de cuvinte, generezi patru variante și te uiți nu la ce e greșit, ci la care dintre ele se apropie cel mai mult de ce voiai. Apoi adaugi un singur element — lumina, de exemplu — și generezi din nou. Apoi încă unul. Schimbând un lucru pe rând, înveți efectiv ce face fiecare cuvânt, iar după câteva zeci de imagini ajungi să anticipezi rezultatul.

Majoritatea instrumentelor oferă și un număr numit seed, care fixează punctul de plecare aleatoriu. Păstrându-l constant și modificând doar descrierea, poți vedea exact ce a schimbat cuvântul adăugat. E cea mai rapidă metodă de învățare.

Principiul e, de altfel, același ca la text — claritatea în formulare produce rezultatul, nu insistența — și se aplică la fel de bine când scrii un prompt bun pentru un asistent AI.

Ce ai voie să faci cu imaginea rezultată

Partea juridică e mai puțin spectaculoasă, dar merită câteva rânduri. În mai multe jurisdicții, o imagine generată integral automat, fără contribuție creativă umană substanțială, nu beneficiază de protecție prin drept de autor. Practic, nu poți împiedica pe altcineva să o folosească.

Apoi, condițiile de utilizare comercială diferă de la un serviciu la altul și depind adesea de tipul de abonament. Merită citite înainte de a pune o imagine pe un ambalaj sau într-o campanie plătită.

Și rămâne o zonă în care prudența e obligatorie: figurile de persoane reale, personajele protejate și stilul recognoscibil al unui artist în viață. Prima ridică probleme de imagine și de date personale, celelalte două de proprietate intelectuală.

Odată depășite primele încercări ratate, lucrul cu aceste instrumente devine surprinzător de precis. Nu pentru că modelul te înțelege mai bine, ci pentru că înveți, treptat, să spui exact ce vezi.