Build a Text-to-Image Generator (from Scratch)
Autor Mark Liuen Limba Engleză Hardback – 23 ian 2026
Codul sursă și accesul la platforma liveBook (care include un asistent AI pentru suport) constituie fundamentul pe care Mark Liu își construiește acest ghid tehnic publicat de Manning Publications. Observăm o abordare riguroasă, de tip „build from scratch”, care demistifică procesele complexe din spatele sistemelor precum DALL-E sau Stable Diffusion. În cele 360 de pagini, găsim o structură progresivă ce transformă conceptele abstracte de învățare automată în aplicații funcționale. Merită menționat că autorul nu se limitează la simpla generare de conținut vizual. Găsim în această carte metodologii detaliate pentru antrenarea modelelor vision transformer, începând de la fragmentarea imaginilor în secvențe de patch-uri, până la implementarea modelelor de difuzie care rafinează zgomotul digital în reprezentări coerente. Pe linia practică a volumului Generative Deep Learning de David Foster, dar cu focus pe implementarea specifică a generatoarelor text-to-image, această lucrare oferă un control granular asupra arhitecturilor neuronale. Spre deosebire de Creating Images Using AI, care se concentrează pe utilizarea platformelor existente precum Midjourney, volumul de față este destinat celor care doresc să programeze și să antreneze propriile modele în Python. Etapele de dezvoltare acoperă scenarii variate: de la clasificarea imaginilor și reconstrucția acestora la înaltă rezoluție, până la tehnici avansate de editare bazate pe prompt-uri. Un aspect distinctiv este capitolul dedicat identificării imaginilor deepfake, o competență esențială în peisajul actual al inteligenței artificiale. Stilul este unul aplicat, facilitând înțelegerea modului în care modelele multimodale pot fi integrate în fluxuri de lucru complexe.
Preț: 357.45 lei
Preț vechi: 446.82 lei
-20%
Carte disponibilă
Livrare economică 04-18 septembrie
Livrare express 20-26 august pentru 41.59 lei
Specificații
ISBN-10: 1633435423
Pagini: 360
Dimensiuni: 212 x 235 x 23 mm
Greutate: 0.65 kg
Editura: Manning Publications
De ce să citești această carte
Această carte se adresează entuziastului în machine learning și specialistului în date care dorește să treacă de la statutul de utilizator de AI la cel de arhitect. Cititorul câștigă o înțelegere profundă a arhitecturilor de tip transformer și diffusion, învățând să construiască sisteme capabile să interpreteze și să genereze imagini. Este resursa ideală pentru a stăpâni procesul tehnic de transformare a textului în realitate vizuală.