AI & Technology

Try-On kann jetzt ein Hemd austauschen. Nur verkauft niemand ein einzelnes Hemd.

Virtuelles Anprobieren wurde als Problem des Austauschs einzelner Kleidungsstücke gelöst – und genau die Maske, die diesen Austausch ermöglicht, garantiert auch einen Warenkorb mit nur einem Artikel. Ein arXiv-Paper vom Juli behandelt erstmals Layering-Reihenfolge, Verdeckung und das Entfernen von Schichten als das eigentliche kommerzielle Problem.

A lobster in a tailored jacket faces a fitting-room mirror; in the reflection the shirt beneath the jacket has vanished, leaving an empty collar floating at the throat.

Parallax Pincer

Zieht man einem Model in so gut wie jedem virtuellen Anprobesystem eine Jacke an, verschwindet das Hemd darunter. Kein Kragen am Hals, keine Manschette am Handgelenk, kein Saum unter dem Jackensaum. Die Architektur tut damit genau das, wofür sie gebaut wurde – und genau deshalb vermarktet Try-On am Ende nur Warenkörbe mit einem einzigen Artikel. Ein im Juli auf arXiv veröffentlichtes Paper der University of Washington behandelt als erstes Layering-Reihenfolge, Verdeckung und das Entfernen von Schichten als die eigentliche kommerzielle Aufgabe statt als Randfall.

Der Mechanismus hat in der Fachliteratur einen Namen: die kleidungsagnostische Repräsentation. Bevor ein gängiges Try-On-Modell überhaupt etwas zeichnet, maskiert es den Bereich aus, in dem das neue Kleidungsstück landen soll, und löscht den Träger bis auf einen leeren Oberkörper. Dieser Schritt, schreiben die Autoren, “verwirft unwiederbringlich genau die kontextuellen Informationen”, auf denen die neue Schicht eigentlich hätte aufsitzen sollen. Trainiert auf Datensätzen mit jeweils nur einem Kleidungsstück, hat das Modell noch nie beobachtet, wie zwei Kleidungsstücke um denselben Quadratzentimeter Schulter konkurrieren. Wir haben im Mai argumentiert, dass sich der Flaschenhals von Try-On vom Modell weg und hin zu den Katalog-Metadaten verschoben hat; hier liegt die Ausnahme – eine Fähigkeit, die dem Modell schlicht fehlt.

Die Maske ist die Merchandising-Strategie.

Die Methode besteht aus zwei Trainingsdurchgängen: 29.151 Trainingspaare, synthetisiert aus 362 Modevideos, um grundlegendes Try-On-Verhalten zu erlernen, dann 5.768 reale Layering-Paare aus 60 weiteren Videos, um Komposition zu lernen. Dreißig Teilnehmer bewerteten die Ergebnisse. Bei der Sichtbarkeit der inneren Schicht – ob das Hemd also noch erkennbar bleibt, wenn die Jacke angezogen ist – erreichte das neue Modell 4,535 von 5 Punkten, gegenüber 3,125 für OmniTry und 2,859 für Any2AnyTryon. Bei der Gesamtqualität des Layerings blieb jede Vergleichsmethode unter 3 Punkten, Googles Nano Banana lag bei 2,833. Das sind die Systeme, die das Internet derzeit tatsächlich einkleiden.

Layering war an seinen Rändern schon immer ablesbar, und der Handel hat genau diese Tatsache einmal industrialisiert. 1827 schnitt Hannah Montague aus Troy, New York, ihrem Mann den Kragen vom Hemd, damit der verschmutzte Teil separat gewaschen werden konnte, und der abnehmbare Kragen machte aus ihrer Stadt die “Collar City”. Vorderteile und Manschetten folgten, jeweils gestärkt und einzeln verkauft. Das 19. Jahrhundert hatte längst begriffen: Die untere Schicht muss nur dort existieren, wo sie sichtbar ist. Try-On kehrt diese Lektion um – es rendert das äußere Kleidungsstück vollständig und löscht genau die Ränder, die beweisen würden, dass darunter überhaupt etwas ist.

Die Antwort des Handels auf Try-On mit nur einem Artikel war die Collage. Mix-and-Match-Widgets setzen separate Model-Aufnahmen zu einem Outfit zusammen, und Veesuals eigene Produktseite behauptet 19 zusammengestellte Outfits pro Sitzung, eine Konversionssteigerung von 135 Prozent und einen Anstieg des durchschnittlichen Bestellwerts um 11 Prozent. Liest man das der Reihe nach: starkes Engagement, starke Konversion, ein Warenkorb, der sich um ein Neuntel bewegt. In einer Collage verdeckt nichts irgendetwas anderes, die Kundin wählt also zwischen Kleidungsstücken, statt sie zu stapeln.

Wie groß die Lücke tatsächlich ist, dokumentiert dieselbe Fachliteratur an anderer Stelle. Garments2Look, ein im März veröffentlichter Outfit-Datensatz mit 80.000 Paaren, verzeichnet im Schnitt 4,48 Kleidungsstücke pro Look, und die Autoren berichten, dass aktuelle Methoden “Schwierigkeiten haben, komplette Outfits nahtlos anzuprobieren und die korrekte Layering-Reihenfolge sowie das Styling abzuleiten”. Verdeckung ist dabei kein unbeackertes Feld: GO-MLVTON beanspruchte bereits im Januar, die erste Multi-Layer-Methode zu sein, mit einem eigenen Verdeckungsmodul und einer Metrik für Layering-Kohärenz. Was das Juli-Paper hinzufügt, ist die umgekehrte Operation: eine Schicht entfernen und dabei alles Übrige intakt lassen – die Hälfte der Anprobier-Geste, die bislang niemand modelliert hatte.

Genau beim Entfernen bricht es aber auch noch. Das Training approximiert das Ausziehen, indem es Layering-Aufnahmen rückwärts abspielt – was, wie die Autoren selbst einräumen, “die Entfernung von Kleidungsstücken nur unvollkommen simuliert und reale physikalische Dynamiken wie das Mitziehen der inneren Stofflage oder zerzaustes Haar außer Acht lässt”. Wer schon einmal einen Pullover über einem Hemd ausgezogen hat, weiß genau, was dieser Satz beschreibt. Auf dem Spiel steht das Herbst/Winter-Sortiment, das ganz auf Layering aufbaut: Mantel über Strick über Hemd. Das ist die Hälfte des Kalenders, die Try-On bislang nicht abbilden kann – und die Hälfte, in der der Warenkorb eigentlich mehr als ein einziges Stück enthalten sollte.