Screenreader lesen blinden und sehbehinderten Menschen vor, was auf dem Bildschirm zu sehen ist – auch Bildbeschreibungen, sofern ein Alt-Text hinterlegt ist. Wie ein Alt-Text gestaltet sein muss…
Ehrlich gesagt halte ich da sehr viel von. Wenn man sich mal kritisch die vorgeschlagenen perfekten Alttexte anschaut, dann kann eine KI diese so erstellen. Eine KI (bzw. eine OCR Software) kann dir den Text von Screenshots geben, eine KI kann dir Diagramme beschreiben. Und eine KI kann dir natürlich auch eine relativ okay Beschreibung von Menschen geben, inklusive Gesichtsausdruck. Das schaffen auch lokale Modelle, die auf bezahlbarer Hardware laufen, ohne Cloudzwang. Wer es nicht glaubt, darf es gerne ausprobieren.
Dann hat man im Endeffekt das perfekte erreicht. Jeder kann sich seine Bildbeschreibung nach Wunsch überall im Internet selber klicken, wenn man der Screenreader das vernünftig integriert. Und dann müssen nicht diese unangenehmen Leute auf Mastodon alle Leute anpöbeln und Neulinge aus dem Netzwerk vergraulen, die keine Bildbeschreibungen posten.
Ich hab noch nie gesehen, dass jemand irgendwen anpöbelt, weil ein Mal keine Bildbeschreibung vorhanden war. Das passiert allenfalls bei Leuten, die sich standhaft weigern und/oder die Hinweise ignorieren.
Bei simplen Bildern mögen KIs das heute hinkriegen, je komplexer das Bild, desto stussiger wird das Ergebnis immer noch.
Ich seh das ständig auf Mastodon. Da sind wirklich einige Leute unterwegs, die Meckern über fehlende Bildbeschreibungen zu ihrer Persönlichkeit gemacht haben. Das sind leider auch häufig die harten KI-Gegner und damit sind sie auch für Debatten nicht zu erreichen.
Das Bild zeigt eine humorvoll gestaltete Werbe- bzw. Meme-Grafik: Im Mittelpunkt steht eine grüne Trinkflasche mit schwarzem Deckel und Trageband. In der Flasche schwimmt eine Gurke bzw. Gurkenscheiben. Oben steht groß in Grün: „Gurkolade“, darunter: „nicht nur so da“. Links befindet sich eine Sprechblase mit dem vertikalen Text „Trinksalat“.
Rechts wird die Zusammensetzung humorvoll dargestellt: „95% reines Wasser“ und „5% reine Gurke“. Eine kleine Gurken-Illustration ist oben rechts zu sehen. Auf der Flasche liegen eine Sonnenbrille und ein kleines rot-weiß-pinkes rundes Motiv, wodurch das Bild einen bewusst absurden, sommerlich-lässigen Charakter bekommt. Unten links steht klein: „kaum steuern agrarsubventioniert“. Der Hintergrund ist eine helle Holzoberfläche. Insgesamt wirkt das Motiv wie eine satirische Verpackungs- oder Produktwerbung für ein erfundenes Getränk aus Wasser und Gurke.
So what? Es ist eine brauchbare Beschreibung mit einem kleinen, irrelevanten Fehler, die ausführlicher ist als alles, was jemand anderes schreiben würde. Wenn du blind bist, bekommst du so trotzdem einen sehr guten Eindruck über das Bild.
Diese Stelle demonstriert halt sehr schön das Problem, nämlich dass die KI Bilder nicht versteht. Ich halte es mitnichten für irrelevant, dass die KI den Mund der Flasche nicht erkennt. Hinzu kommt die Brille, die angeblich auf der Flasche “liegt”. Die Beschreibung des tatsächlich irrelevanten Untergrunds ist Audio-Spam. Und die Reihenfolge der einzelnen Elemente halte ich persönlich für mehr verwirrend als informativ. Klar, das ist schon besser, als so einiges, was ich bisher an KI-generierten Beschreibungen gesen habe. Aber hier ist das Bild auch relativ simpel, die einzelnen Elemente sind klar erkennbar.
Was ich sagen will: KI-Modelle können dir sehr ausführliche und brauchbare Bildbeschreibungen geben und daher ist es hart sinnfrei, wenn man großflächig rummosert, dass Bildbeschreibungen fehlen und versuchen zu erzwingen, dass Millionen Menschen ihr Verhalten ändern, wenn es auch eine technische und nutzbare Lösung gibt.
Ich hab jetzt eben ChatGPT genutzt, Gemini erkennt z.B. den Mund:
Das Bild ist eine humorvolle Fotomontage oder ein Meme, das im Stil einer satirischen Werbeanzeige gestaltet ist. Der Hintergrund besteht aus einer hellbraunen Holzoberfläche.
Hauptmotiv
Im Zentrum liegt schräg eine matte, halbtransparente Trinkflasche mit einem schwarzen Deckel und einer schwarzen Trageschlaufe. In der Flasche befinden sich Wasser und mehrere grüne Gurkenscheiben. Der Flasche wurde digital ein Gesicht verpasst: Sie „trägt“ eine dunkle Sonnenbrille und hat einen weit aufgerissenen, stilisierten Mund (ähnlich einem Emoji, mit roten, weißen und pinken Flächen).
Texte und grafische Elemente
Rund um die Flasche sind verschiedene ironische Slogans und Grafiken platziert:
Titel: Oben steht groß in weißer Schrift mit dickem grünen Rand das erfundene Wort „Gurkolade“. Direkt darunter steht in kleinerer weißer Schrift der Slogan „nicht nur so da“. Oben rechts in der Ecke schwebt zudem ein kleines Gurken-Clipart.
Linke Seite: Eine große weiße Sprechblase zeigt auf die Flasche. Darin steht um 90 Grad gedreht in grüner Schrift das Wort „Trinksalat“.
Rechte Seite: Hier werden die „Inhaltsstoffe“ in zwei Badges hervorgehoben. Ein blauer Wassertropfen enthält den weißen Text „95% reines Wasser“. Darunter liegt ein grüner Kreis mit dem weißen Text „5% reine Gurke“.
Unten links: Als eine Art „Kleingedrucktes“ steht dort in weißer Schrift: „kaum steuern agrarsubventioniert“.
Insgesamt parodiert das Bild typische, moderne Marketing-Kampagnen für hippe Lifestyle-Getränke oder Ersatzprodukte (wie beispielsweise Hafermilch), indem es völlig gewöhnliches Gurkenwasser völlig überzogen als innovatives Produkt darstellt.
Schönes Beispiel, warum mich diese Diskussion so abfuckt: Der Gemini-Text ist 1281 Zeichen lang. Das Beispiel für “den perfekten Alt-Text” aus dem Artikel hat 794 Zeichen. Du landest da bei einem Textlängenunterschied von etwas über 2 SMS. Abgesehen davon kannst du natürlich dein Modell auf eine Wunschlänge prompten.
Wenn man nicht wahrhaben will, dass man mit technischen Lösungen das Gewünschte erreichen kann, dann sollte man auch keine Diskussion anfangen oder ständig die Baseline verschieben. Oder um es anders zu sagen: Ja, KI kann dir eine brauchbare Bildbeschreibung erstellen. Das muss niemand anderes machen. Wenn du eine kurze Bildbeschreibung willst, dann stell deine Software so ein, dass sie dir eine kurze Beschreibung gibt.
was haltet ihr davon dass bildbeschreibungen automatisch durch ne KI erstellt werden?
Ehrlich gesagt halte ich da sehr viel von. Wenn man sich mal kritisch die vorgeschlagenen perfekten Alttexte anschaut, dann kann eine KI diese so erstellen. Eine KI (bzw. eine OCR Software) kann dir den Text von Screenshots geben, eine KI kann dir Diagramme beschreiben. Und eine KI kann dir natürlich auch eine relativ okay Beschreibung von Menschen geben, inklusive Gesichtsausdruck. Das schaffen auch lokale Modelle, die auf bezahlbarer Hardware laufen, ohne Cloudzwang. Wer es nicht glaubt, darf es gerne ausprobieren.
Dann hat man im Endeffekt das perfekte erreicht. Jeder kann sich seine Bildbeschreibung nach Wunsch überall im Internet selber klicken, wenn man der Screenreader das vernünftig integriert. Und dann müssen nicht diese unangenehmen Leute auf Mastodon alle Leute anpöbeln und Neulinge aus dem Netzwerk vergraulen, die keine Bildbeschreibungen posten.
Ich hab noch nie gesehen, dass jemand irgendwen anpöbelt, weil ein Mal keine Bildbeschreibung vorhanden war. Das passiert allenfalls bei Leuten, die sich standhaft weigern und/oder die Hinweise ignorieren.
Bei simplen Bildern mögen KIs das heute hinkriegen, je komplexer das Bild, desto stussiger wird das Ergebnis immer noch.
Ich seh das ständig auf Mastodon. Da sind wirklich einige Leute unterwegs, die Meckern über fehlende Bildbeschreibungen zu ihrer Persönlichkeit gemacht haben. Das sind leider auch häufig die harten KI-Gegner und damit sind sie auch für Debatten nicht zu erreichen.
Probiere es mal aus, was passiert, wenn du eine KI auf !ich_iel loslässt.
Ist durchaus brauchbar:
danke dir. ist tatsächlich ganz brauchbar.
So what? Es ist eine brauchbare Beschreibung mit einem kleinen, irrelevanten Fehler, die ausführlicher ist als alles, was jemand anderes schreiben würde. Wenn du blind bist, bekommst du so trotzdem einen sehr guten Eindruck über das Bild.
Diese Stelle demonstriert halt sehr schön das Problem, nämlich dass die KI Bilder nicht versteht. Ich halte es mitnichten für irrelevant, dass die KI den Mund der Flasche nicht erkennt. Hinzu kommt die Brille, die angeblich auf der Flasche “liegt”. Die Beschreibung des tatsächlich irrelevanten Untergrunds ist Audio-Spam. Und die Reihenfolge der einzelnen Elemente halte ich persönlich für mehr verwirrend als informativ. Klar, das ist schon besser, als so einiges, was ich bisher an KI-generierten Beschreibungen gesen habe. Aber hier ist das Bild auch relativ simpel, die einzelnen Elemente sind klar erkennbar.
Was ich sagen will: KI-Modelle können dir sehr ausführliche und brauchbare Bildbeschreibungen geben und daher ist es hart sinnfrei, wenn man großflächig rummosert, dass Bildbeschreibungen fehlen und versuchen zu erzwingen, dass Millionen Menschen ihr Verhalten ändern, wenn es auch eine technische und nutzbare Lösung gibt.
Ich hab jetzt eben ChatGPT genutzt, Gemini erkennt z.B. den Mund:
Das Bild ist eine humorvolle Fotomontage oder ein Meme, das im Stil einer satirischen Werbeanzeige gestaltet ist. Der Hintergrund besteht aus einer hellbraunen Holzoberfläche.
Hauptmotiv Im Zentrum liegt schräg eine matte, halbtransparente Trinkflasche mit einem schwarzen Deckel und einer schwarzen Trageschlaufe. In der Flasche befinden sich Wasser und mehrere grüne Gurkenscheiben. Der Flasche wurde digital ein Gesicht verpasst: Sie „trägt“ eine dunkle Sonnenbrille und hat einen weit aufgerissenen, stilisierten Mund (ähnlich einem Emoji, mit roten, weißen und pinken Flächen).
Texte und grafische Elemente Rund um die Flasche sind verschiedene ironische Slogans und Grafiken platziert:
Titel: Oben steht groß in weißer Schrift mit dickem grünen Rand das erfundene Wort „Gurkolade“. Direkt darunter steht in kleinerer weißer Schrift der Slogan „nicht nur so da“. Oben rechts in der Ecke schwebt zudem ein kleines Gurken-Clipart.
Linke Seite: Eine große weiße Sprechblase zeigt auf die Flasche. Darin steht um 90 Grad gedreht in grüner Schrift das Wort „Trinksalat“.
Rechte Seite: Hier werden die „Inhaltsstoffe“ in zwei Badges hervorgehoben. Ein blauer Wassertropfen enthält den weißen Text „95% reines Wasser“. Darunter liegt ein grüner Kreis mit dem weißen Text „5% reine Gurke“.
Unten links: Als eine Art „Kleingedrucktes“ steht dort in weißer Schrift: „kaum steuern agrarsubventioniert“.
Insgesamt parodiert das Bild typische, moderne Marketing-Kampagnen für hippe Lifestyle-Getränke oder Ersatzprodukte (wie beispielsweise Hafermilch), indem es völlig gewöhnliches Gurkenwasser völlig überzogen als innovatives Produkt darstellt.
Ich hab diese Wand aus Text nicht gelesen und ich würde sie mir auch nicht anhören. Mehr Details sind nicht immer besser.
Schönes Beispiel, warum mich diese Diskussion so abfuckt: Der Gemini-Text ist 1281 Zeichen lang. Das Beispiel für “den perfekten Alt-Text” aus dem Artikel hat 794 Zeichen. Du landest da bei einem Textlängenunterschied von etwas über 2 SMS. Abgesehen davon kannst du natürlich dein Modell auf eine Wunschlänge prompten.
Wenn man nicht wahrhaben will, dass man mit technischen Lösungen das Gewünschte erreichen kann, dann sollte man auch keine Diskussion anfangen oder ständig die Baseline verschieben. Oder um es anders zu sagen: Ja, KI kann dir eine brauchbare Bildbeschreibung erstellen. Das muss niemand anderes machen. Wenn du eine kurze Bildbeschreibung willst, dann stell deine Software so ein, dass sie dir eine kurze Beschreibung gibt.
könnte auch client-side sein.