Rita en bild och följ hur en dator steg för steg går från pixlar till en gissning.
Bilden – 16 × 16pixlar
Visa pixelvärden (0–255)
Klicka på ett filter nedanför för att börja.
Leta efter mönster med ett filter (faltning)
Varje filter hittar olika mönster
Ett filter räcker inte för att förstå en bild. Därför använder riktiga CNN:er många olika filter samtidigt. Klicka på en eller flera kartor och se hur de tillsammans fångar allt mer av bilden.
Beslutet
Varje filterkarta summeras till ett tal: hur mycket filtret reagerade. Fyra tal – det är hela modellens minne av bilden.
Modellen jämför bildens signatur med de fyra former den känner till och gör en klassificering: den form vars signatur liknar bildens mest blir gissningen.
Vår minimodell och riktiga bildmodeller bygger på samma grundprincip, men skiljer sig enormt i skala.
Likheter
• Båda ser bilder som rutnät av tal.
• Båda använder filter som glider över bilden och letar mönster.
• Båda kokar ner bilden till en signatur som styr beslutet.
Skillnader
• I simuleringen är filtren bestämda i förväg, medan riktiga CNN:er själva lär sig vilka filter som fungerar bäst under träningen.
• Riktiga nätverk staplar många lager: första lagret ser kanter, nästa ser former, nästa ser ögon, hjul, ansikten…
• Bilderna är miljontals pixlar i färg, inte 16×16 i gråskala.
• Vår modell känner till 4 former. Riktiga modeller kan skilja på tusentals objekt.
Modellen kan bara välja mellan fyra former – lodrät linje, vågrät linje, kryss och cirkel. Ritar du något helt annat, till exempel ett hus eller en katt, måste den ändå välja den form som liknar bilden mest – bara mer osäkert.
Först blir bilden ett rutnät av tal. En bild på 16 gånger 16 pixlar blir 256 tal mellan 0 och 255.
Sedan söker fyra olika filter igenom bilden efter olika typer av mönster. Varje filter skapar en egen featurekarta med 196 tal.
Varje featurekarta sammanfattas sedan till ett enda tal som beskriver hur starkt just det filtret reagerade – ett steg som kallas pooling. De fyra talen bildar tillsammans en enkel beskrivning av bilden. I simuleringen kallar vi den bildens signatur.
Till sist jämförs signaturen med de fyra former modellen känner till, och den mest lika formen vinner.
Det här kallas ett faltningsnätverk i miniformat. Det bygger på samma princip som ansiktsigenkänning och självkörande bilar, men de riktiga nätverken använder miljontals inlärda filter i många lager.
Hur ser en dator?
I den här simuleringen får du följa hur en enkel bildmodell går från att tolka en bild som ett rutnät av tal till en gissning av vad bilden föreställer.
Modellen du bygger kallas ett faltningsnätverk (CNN) – en teknik som låter datorer tolka foton, känna igen ansikten och läsa av vägskyltar. Så här går det till: