Proces generovania obrazu pomocou difúznych modelov nie je magické vytváranie pixelov z ničoho, ale prísne definovaný matematický postup. Na začiatku stojí Gaussov šum, ktorý model postupne "odšumuje" na základe naučených vzorov. Tento proces prebieha v takzvanom latentnom priestore, čo je komprimovaná reprezentácia obrazu, ktorá šetrí výpočtové zdroje pri zachovaní vysokej sémantickej presnosti.
Kľúčovým faktorom je UNet architektúra, ktorá predpovedá množstvo šumu prítomného v každom kroku iterácie. Textový enkodér (zvyčajne CLIP) prekladá ľudské zadanie do vektorov, ktoré usmerňujú proces odšumovania. Týmto spôsobom sa abstraktné dáta transformujú na konkrétne vizuálne štruktúry. Pre hlbšie pochopenie implementácie odporúčame našu sekciu Optimalizácia pracovných postupov.
"Difúzia je v podstate hľadanie poriadku v absolútnom chaose matematicky riadenou cestou."