Generátory obrázků: jak z textového zadání vzniká obraz
Generátor obrázků začíná u náhodného šumu, podobného zrnění na staré televizi, a postupně ho mění tak dlouho, až z něj vystoupí obraz odpovídající textovému zadání. Nevybírá z databáze hotových obrázků a nic neskládá z výstřižků. Každý výsledek vzniká nově, a proto dvě stejná zadání dají dva různé obrázky.
Princip difuzního modelu
Model se učil na obrovském množství obrázků s popisky. Při tréninku se k obrázkům po krocích přidával šum, až z nich nezbylo nic, a síť se učila opačný postup: odhadnout, jaký šum byl přidán, a odebrat ho.
Při generování se tento naučený postup spustí od čistého šumu. V každém kroku model odhadne, co je šum a co obraz, a kousek šumu odstraní. Po několika desítkách kroků je hotovo. Většina dnešních nástrojů pracuje pro úsporu výkonu ve zmenšené, takzvané latentní reprezentaci a teprve na konci ji převede na plné rozlišení.
Jak se do procesu dostane text
Zadání nejprve zpracuje jazyková část, která ho převede na číselnou reprezentaci významu. Ta potom řídí každý krok odstraňování šumu a tlačí vznikající obraz směrem k popisu.
Model se při tréninku naučil spojení mezi slovy a vizuálními vzory. Ví, jak vypadá kočka, jak akvarel a jak večerní světlo, a umí tyto pojmy kombinovat do scén, které v trénovacích datech nikdy nebyly. Odtud kočka v akvarelu při večerním světle, kterou nikdo nenamaloval.
Proč vznikají chyby
Model nerozumí světu, zná jen statistiku obrazů. Neví, že ruka má pět prstů, ví, jak ruce obvykle vypadají, a ty jsou na fotografiích v nesčetných polohách, často zpola zakryté. Proto dlouho patřily deformované ruce k poznávacím znamením. Novější modely se výrazně zlepšily, chyby v anatomii a v počtu předmětů se ale objevují dál.
Podobně je to s textem v obraze. Písmena jsou pro model tvary, ne znaky s významem, a nápisy bývaly nesmyslné. I zde došlo k pokroku, u delších textů a u češtiny s diakritikou ovšem spolehlivost klesá.
Třetí slabinou jsou prostorové vztahy a přesné počty. Zadání se třemi červenými míči nalevo od modré krabice splní model jen někdy.
Jak psát zadání
Dobré zadání popisuje, co je na obrázku, v jakém prostředí, v jakém stylu a s jakým světlem. Konkrétnost pomáhá. Místo slova pes napište, jaký pes, co dělá a kde. Uveďte, zda chcete fotografii, kresbu tuší nebo plakát, a případně kompozici.
Starší modely vyžadovaly výčty klíčových slov, novější lépe rozumějí běžným větám. Mnoho nástrojů umožňuje výsledek upravovat v rozhovoru: požádat o jinou barvu, odstranit předmět, změnit formát.
Za užitečné považuji generovat několik variant naráz a vybírat. Náhoda je součástí procesu a první pokus málokdy bývá nejlepší.
Úpravy existujících obrázků
Stejná technologie slouží k úpravám. Lze označit část fotografie a nechat ji nahradit něčím jiným, rozšířit obraz za původní okraje nebo odstranit rušivý objekt. Tyto funkce se staly součástí běžných fotoeditorů i telefonů a pro většinu lidí jsou užitečnější než tvorba obrázků od nuly.
Otázky kolem autorství a tréninku
Modely se učily na obrázcích z internetu, z velké části bez vědomí jejich autorů. Probíhají o tom soudní spory a debata, jak mají být tvůrci odměněni. Stejně nevyjasněná je otázka, komu patří práva k vygenerovanému obrázku. Právní pohled se vyvíjí a liší se mezi zeměmi, a kdo chce výstupy používat komerčně, měl by si přečíst licenční podmínky konkrétního nástroje a případně se poradit s právníkem.
Označování a zodpovědné používání
Evropská pravidla vyžadují, aby byl uměle vytvořený obsah rozpoznatelný. Nástroje proto do souborů vkládají neviditelné značky nebo údaje o původu a platformy zavádějí štítky. Obraz zachycující skutečného člověka v situaci, která nenastala, může ublížit, a nástroje takové požadavky zpravidla odmítají. O rozpoznávání podvržených záběrů píšu v textu o deepfake videích.
Jak začít
Vyzkoušejte některý z volně dostupných nástrojů na něčem, co potřebujete: ilustraci k pozvánce, obrázek do prezentace, návrh loga pro spolek. Napište zadání, prohlédněte výsledek a přepište to, co nesedí. Po deseti pokusech získáte cit pro to, na co model slyší. Častou chybou je vzdát to po prvním nepovedeném obrázku nebo naopak použít první výsledek bez kontroly detailů. Podívejte se na ruce, na nápisy a na pozadí, tam se chyby schovávají. Širší souvislosti dává přehled o přínosech a limitech umělé inteligence a textovým nástrojům se věnuje článek o chatbotu jako pomocníkovi při studiu.
Zdroje
- Nařízení (EU) 2024/1689, kterým se stanoví harmonizovaná pravidla pro umělou inteligenci (akt o umělé inteligenci)
- Standard pro původ a pravost obsahu, Coalition for Content Provenance and Authenticity (C2PA)
- AI Index Report, Stanford Institute for Human-Centered Artificial Intelligence
- Dokumentace a licenční podmínky, poskytovatelé nástrojů pro generování obrázků
Publikováno: 28. 09. 2026
Kategorie: společnost