BITVISTeknik, bit för bit.Driftkostnad: 190 kr

21 augusti 2026

Hur AI-genererade bilder skapas — bit för bit

En AI "ritar" inte dina bilder. Den avbrusar dem — från slumpmässigt brus till igenkännbar bild, steg för steg.

Du skriver "en katt i rymddräkt" och två sekunder senare finns bilden där. Det ser ut som magi. Men en bild-AI ritar inte. Den startar med rent brus — helt slumpmässiga pixlar, som TV-static — och arbetar fram bilden bit för bit.

Vad "diffusion" betyder

Tekniken kallas diffusion, från latinets ord för "spridning". Grundidén är nästan barnsligt enkel: ta en riktig bild och lägg på lite brus. Sedan lite till. Och lite till. Efter ungefär 1000 små steg är bilden helt förstörd — bara slumpmässig statisk kvar.

Modellen tränas på att göra omvänt

Här är tricket. Man visar modellen miljontals bilder och låter den träna på att göra processen baklänges: från brus tillbaka till bild. För varje steg lär den sig gissa vad som ska tas bort för att bilden ska bli en aning klarare.

Efter träningen kan den något som ingen programmerare skrev in manuellt — ta bort brus den aldrig sett förut.

Så går det till när du skriver en prompt

När du skriver "en katt i rymddräkt" börjar modellen med 100 % slumpmässigt brus. Sedan avbrusar den bilden i ungefär 50 steg. I varje steg blir bilden lite skarpare. Efter ungefär 50 steg finns där en katt i rymddräkt — där det för en halv sekund sedan bara var statisk.

Din prompt styr vad som ska "finnas i bruset" genom en textmodell som talar om för bildmodellen vad den ska leta efter i varje steg.

Varför 1000 steg blev 50

Att köra alla 1000 steg är långsamt. Metoder som DDIM visade att man kan hoppa över steg — ta genvägar — och ändå få nästan lika bra bild. Resultatet: ungefär 20 gånger snabbare, med nästan ingen kvalitetsförlust.

Varför det inte är "ritande"

Det här förklarar också varför AI kämpar med vissa saker. En målare ritar fem fingrar medvetet. En diffusionsmodell avbrusar bara tills något ser rimligt ut — och struktur som händer och text är just sånt som lätt blir "nästan rätt men fel". Men det är ett eget ämne.

Poängen just nu: AI-bilden ritades inte. Den växte fram ur statisk.

Nästa gång du ser en AI-bild, tänk på att den startade som ett lager brus som skalades bort i ett 50-tal små steg.

Källa: DDPM (Denoising Diffusion Probabilistic Models, Ho et al. 2020) tränar med 1000 brussteg. DDIM (Song et al. 2021) visade att man kan generera med cirka 50 steg och få ungefär 20 gånger snabbare sampling; Stable Diffusion använder 50 avbrusningssteg som standard.