368 Pferdememes. Bildschirmfotos aus dem eigenen Instagram-Feed, zwischen Juni 2025 und April 2026.
Wofür wurde der Datensatz angelegt, und von wem?
Das erste Bild entstand am 26. Juni 2025. Das letzte am 4. April 2026. Dazwischen liegen 282 Tage. An 28 davon habe ich Bildschirmfotos gemacht. Am 19. August 2025 waren es 132 Stück.
Die Bilder zeigen Pferde. Sonst haben sie nichts gemeinsam.
Ausgesucht hat sie nicht ich allein. Instagram entscheidet, was im Feed erscheint; ich habe entschieden, was davon bleibt. Der Datensatz ist das Protokoll dieser beiden Entscheidungen, und er lässt sich nicht in zwei Teile zerlegen.
Angelegt von Stephan Nachreiner, Klasse Vernetzte Materialität, Akademie der Bildenden Künste Nürnberg. Kein Auftrag, keine Förderung.
Was ist ein Datenpunkt, wie viele gibt es, und was fehlt?
Ein Datenpunkt ist ein Bildschirmfoto mit vier Angaben: Datum, Originalformat, Pixelmaße, Dateigröße. Später kamen zwei dazu: ein per OCR ausgelesener Bildtext und eine Motivklasse, die ich vergeben habe.
Bei 125 Bildern stammt das Datum aus den EXIF-Daten der Aufnahme. Bei 243 aus dem Dateidatum. Der Unterschied ist nicht dekorativ. Das Dateidatum ändert sich beim Kopieren; das EXIF-Datum nicht. Bei 243 Bildern weiß ich also nicht sicher, wann ich sie aufgenommen habe.
Menschen kommen in diesem Datensatz zweimal vor: auf den Bildern und hinter ihnen. Wer die Bilder gemacht hat, steht bei 26 Einträgen fest. Bei 342 nicht. Der Kontoname lag außerhalb des Ausschnitts, den ich gewählt habe. Ich wollte das Bild. Den Namen habe ich weggeschnitten, ohne darüber nachzudenken.
Die größte Klasse heißt ohne Text und enthält 142 Bilder. Das sind 39 Prozent. Eine Klasse, die mehr als ein Drittel des Bestands aufnimmt, ordnet nichts. Sie sagt nur, was ich beim Sichten nicht entscheiden wollte.
Wie wurde gesammelt, über welchen Zeitraum, mit wessen Zustimmung?
Mit einem iPhone. Zwei Knöpfe gleichzeitig. Kein Skript, kein Scraper, keine Schnittstelle.
Gesammelt wurde beim Anschauen, nicht nach Plan. Deshalb die Verteilung: an zwei Abenden 252 Bilder, an den übrigen 26 Tagen zusammen 116. Wer daraus auf Pferdememes im Allgemeinen schließt, schließt auf zwei Abende im Sommer 2025.
Eine Zustimmung der Urheber:innen liegt nicht vor. Ich habe keine eingeholt. Das ist bei Bilddatensätzen aus dem Netz der Normalfall, und es ist der Punkt, an dem Adam Harveys Exposing.ai ansetzt. Der Unterschied ist die Zahl. Bei 368 Bildern kann ich jedes einzelne benennen. Bei fünf Milliarden kann das niemand.
Ab dem 27. September 2026 kam ein Skript dazu. Es fragt zweiundzwanzig Seiten ab — Memeseiten wie imgflip und 9GAG, Fediverse-Zeitleisten, Bildarchive. 1103 Bilder sind so hereingekommen. Das Skript liegt dem Datensatz bei.
Die maschinelle Erhebung unterscheidet sich in einem Punkt von der ersten: Wo eine Plattform ein Konto nennt, wird es mitgeschrieben. Bei 626 der 1103 Bilder ist die Urheberschaft dadurch belegt. Beim Bildschirmfotografieren ging sie verloren, hier bleibt sie erhalten. Es ist derselbe Sammler, dasselbe Interesse — nur ein anderes Werkzeug, und das Werkzeug entscheidet mit, was übrig bleibt.
Von den 1103 maschinell gefundenen Bildern sind 515 Memes. 588 nicht. Die Maschine kennt den Unterschied nicht.
Der Grund liegt in den Suchwörtern. Unter dem Schlagwort horse steht auf einer Memeseite ein Witz, auf einer Fotoplattform ein Pferd. Die Abfrage ist dieselbe. Von 600 Bildern aus Mastodon-Zeitleisten waren zwölf Memes: zwei Prozent. Der Rest war Reitsportfotografie, Bronzeskulpturen, Rennbahnwerbung, Buchcover und sehr viel My Little Pony.
Ich habe alle 1103 einzeln angesehen und entschieden. Vier Urteile: Meme, kein Meme, Cartoon-Pony, unklar. Es gibt keine Regel dafür, nach der jemand anderes zum selben Ergebnis käme. Ob ein Pferd auf einem Autodach ein Meme ist oder ein Unfallfoto, ist keine Eigenschaft des Bildes. Es ist meine Entscheidung, und sie steht bei jedem Bild dabei.
Aussortiertes wurde nicht gelöscht. Es liegt im Datensatz, klein gerechnet, mit dem Grund seines Ausschlusses, und ist im Feld über Ausschuss zeigen abrufbar. Die Silhouette zeigt 883 Bilder. Der Datensatz enthält 1471. Die Differenz ist kein Fehler, sondern der Teil, über den entschieden wurde.
Was wurde am Rohmaterial verändert, und was ging dabei verloren?
254 Bilder wurden beschnitten. Weg sind: Statusleiste, Uhrzeit, Kontoname, die Schaltfläche Folgen, die Zeile Gefällt … und weiteren Personen, der Kommentarbalken, der Stummschalt-Knopf, die Punkte für die Bildposition im Beitrag.
Dieser Schnitt ist der folgenreichste Eingriff des Projekts. Er macht aus einem Beitrag ein Bild. Aus einem Konto eine Leerstelle. Ein zweiter, maschineller Durchgang fand bei 42 Bildern Reste der Oberfläche und entfernte sie; in der Karteikarte steht, was jeweils weggeschnitten wurde. Rund 40 Aufnahmen stammen nicht von Instagram, sondern von Reddit, Pinterest oder aus Suchergebnissen. Deren Oberflächen sind teilweise noch im Bild.
Bei 26 Bildern ließ sich der Kontoname aus den unbeschnittenen Originalen wieder auslesen. Bei 342 nicht. Die Originale liegen vollständig vor.
Der Bildtext stammt aus einer Texterkennung und ist nicht korrigiert. Bei 10 Bildern findet sie nichts, weil keiner da ist. Die Motivklassen habe ich in einem Durchgang vergeben, allein, ohne zweite Meinung, und die Klassen erst beim Sichten erfunden.
Wofür ist der Datensatz benutzt worden, wofür sollte er nicht benutzt werden?
Bisher als Material für die folgenden Arbeiten.
Recherche zur Herkunft der Bilder.
Link folgtTextilarbeit. Das Material bekommt Gewicht und Maß.
Link folgtFotografische Arbeit im Umfeld der Decke.
Link folgtDer Ort, an dem gesammelt wurde.
Link folgtWofür er sich nicht eignet: als Trainingsmaterial mit Anspruch auf Repräsentativität. Er bildet einen Feed ab, im deutschsprachigen Raum, im Jahr 2025. Die Klassen stammen von einer Person. Die Urheberschaft ist zu 93 Prozent gelöscht. Wer damit ein Modell trainiert, trainiert auf meinen Geschmack.
Unter welcher Lizenz wird weitergegeben, und wer pflegt den Bestand?
Eine Lizenz kann ich nicht erteilen. Die Rechte an den Bildern liegen bei anderen, bei 342 von ihnen bei Unbekannten. Weitergegeben wird die Sammelarbeit: die Auswahl, die Ordnung, die Beschreibung. Das ist weniger als eine Lizenz. Es ist mehr, als die meisten Trainingsdatensätze angeben.
Der Bestand wächst auf drei Wegen: von Hand fotografiert, maschinell gefunden, über den Aufnahmeschein eingereicht. Jedes Bild trägt, welcher davon es war. Über den Aufnahmeschein im Feld kommen neue Bilder dazu; sie tragen ihr Aufnahmedatum und sind im Filter Zugänge getrennt abrufbar. Die Zahl im Titel bleibt bei 368, weil sie den Stand der ersten Erhebung bezeichnet.
Wer ein eigenes Bild wiedererkennt und die Entfernung wünscht, bekommt sie. Ohne Begründung, ohne Nachfrage. Das ist die einzige Form von Zustimmung, die sich nachträglich noch herstellen lässt.
Timnit Gebru u. a., Datasheets for Datasets (2018/2021) — die Form dieses Dokuments.
Mimi Onuoha, On Missing Data Sets (2016) — zu den 342 Leerstellen.
Hito Steyerl, A Sea of Data (2016) — zu dem, was beim Bereinigen herausfällt.
Everest Pipkin, On Lacework (2020) — zum Ansehen jedes einzelnen Eintrags.
Adam Harvey, Exposing.ai — zu Einwilligung und Herkunft.
Martin Herbert, Tell Them I Said No (2016) — zur Verweigerung, hier ungefragt vollzogen.