Eine generative KI zu bitten, „Ihr Produkt in einen hübschen Hintergrund zu setzen", ist zum Reflex geworden. Es ist schnell, kostenlos, und das Foto sieht oft gut aus. Aber ist das Produkt auf dem Bild wirklich Ihres?
Um das zu prüfen, haben wir ein echtes Produkt unseres Kunden Polimair genommen : den Stuhl Beluga, drei Beine, Schale und Sitzfläche in zwei Farben. Wir haben ChatGPT und Gemini dasselbe Referenzfoto und dieselbe, Wort für Wort identische Vorgabe gegeben. Dann haben wir dieselben Varianten mit dem KI-Fotostudio von 3DVue generiert, ausgehend vom exakten 3D-Modell des Stuhls.
Wir veröffentlichen alles, auch das, was bei uns nicht gut funktioniert. Das ist der einzige Weg, diesen Test nützlich zu machen.
Das Vorgehen
- 1 Produkt : der Stuhl Beluga von Polimair, ein echtes 3D-Modell und ein echtes Produktfoto als Referenz.
- Dieselbe schriftliche Vorgabe, Wort für Wort, für jede Generierung an ChatGPT und Gemini gegeben : realistischer Lebenshintergrund, dieselben erwarteten Farben wie auf dem bereitgestellten Foto.
- KI-Fotostudio : das 3D-Modell importiert, die Farbvarianten in einer einzigen Charge markiert, ein Hintergrund für die gesamte Gruppe gewählt.
- Bewertungsraster für jedes Bild : Form eingehalten, exaktes Material und Farbe, Details (Beine, Schwung, Verbindung), Konsistenz zwischen den Bildern, Zeitaufwand, Kosten.
Das den drei Tools gegebene Referenzfoto wird hier nicht veröffentlicht : Es ist ein Visual aus dem Katalog von Polimair, noch nicht für eine öffentliche Veröffentlichung vorgesehen. Alle von den drei Tools erzeugten Ergebnisse hingegen werden unverändert gezeigt.
Was ChatGPT und Gemini produziert haben
Mit demselben Foto und derselben Vorgabe zeichnen beide Tools das Produkt neu, statt es zu reproduzieren. ChatGPT platziert den Stuhl mitten im Raum, in falschen Farben, mit völlig missratenen Armlehnen. Gemini verfehlt die Perspektive und erfindet eine Form mit 4 Beinen, komplett halluziniert. In beiden Fällen überlebt die charakteristische Form der Beluga, ihre 3 Beine, ihre Proportionen, den Durchlauf durch die KI nicht.
Schlecht platzierter Stuhl mitten im Raum, Farben und Armlehnen missraten
Verfehlte Perspektive, 4 Beine, komplett halluzinierte Form
Keines der beiden bietet eine Chargenverarbeitung für diese Art von Anfrage : Jede Farb- oder Hintergrundvariante erfordert einen neuen Prompt, eine neue Wartezeit, und dasselbe Risiko, das Produkt jedes Mal anders neu gezeichnet zu sehen.
Ergebnisse auf einen Blick
| Kriterium | ChatGPT | Gemini | KI-Fotostudio 3DVue |
|---|---|---|---|
| Form eingehalten | ❌ 3 Beine durch Zufall, aber Stuhl schlecht platziert mitten im Raum, Armlehnen völlig missraten | ❌ Verfehlte Perspektive, 4 Beine, komplett halluzinierte Form | ✅ 3 Beine in allen Varianten erhalten, es ist das 3D-Modell des Kunden |
| Exaktes Material / Farbe | ❌ Erfundene, ungefähre Farben | ❌ Erfundene Farben, nur ein Ton | ✅ Die echten Farben des 3D-Modells, Variante für Variante |
| Details (Beine, Schwung, Verbindung) | ❌ Armlehnen missraten, generische Silhouette | ❌ Inkonsistente Struktur, halluzinierte Verbindung | ✅ Identisch mit dem von Polimair bereitgestellten 3D-Modell |
| Konsistenz zwischen den Bildern | n/v (1 Bild erzeugt) | ⚠️ Zwei Versuche, zwei unterschiedliche Formen, keine davon korrekt | ✅ Dasselbe Produkt, derselbe Hintergrund auf der gesamten Charge |
| Zeitaufwand | 2 bis 3 Min. pro Bild (Prompt + bereitzustellendes Referenzfoto) | 2 bis 3 Min. pro Bild, ein Bild nach dem anderen | Packshot : 1 Klick, 2 bis 3 Min. für die gesamte Variantencharge. Hintergrund : ~3 Min. zum Einstellen der Szene, dann 15 Sek. pro Bild, bis zu 25 auf einmal gestartet |
| Kosten | Kostenlos | Kostenlos | 1 € zzgl. MwSt. pro Bild (2 Tokens), in einem kostenpflichtigen Tarif enthalten |
Was das KI-Fotostudio produziert hat
Das KI-Fotostudio geht vom exakten 3D-Modell des Beluga-Stuhls aus, geliefert von Polimair. Die KI erzeugt nur den Hintergrund drumherum : Das Produkt selbst stammt aus der 3D-Datei, mit seinen echten Proportionen und echten Farben.
4 der 8 echten Farben des Beluga-Stuhls, generiert in derselben Charge aus dem 3D-Modell. Dieselben 3 Beine, dieselben Proportionen bei allen 8.
Mehrere Lichtstimmungen, dasselbe Produkt
Der Studio-Packshot bietet auch mehrere Lichteinstellungen, vor dem Start der Charge auswählbar. Immer dasselbe Produkt, nur das Licht ändert sich :
Soft studio (sanftes Licht, leichte Schatten), High contrast (markante Schatten, mehr Plastizität), Backlight (beleuchteter Produktumriss), Natural light. Eine Einstellung für die gesamte Produktreihe, nicht Farbe für Farbe neu zu machen.
Die Farben können anschließend in Szene gesetzt werden, immer mit demselben exakten Produkt :
Die Fehlversuche des KI-Fotostudios
Auch das KI-Fotostudio gelingt nicht jedes Mal. Bei diesem Test kam es vor, dass der generierte Stuhl über einen bereits im Hintergrund vorhandenen Sessel platziert wurde, statt daneben. In diesem Fall muss das Rendering dieses Bildes neu gestartet werden, was ein paar Sekunden mehr dauert. Form und Farben des Produkts bleiben dabei immer exakt : nur die Platzierung in der Szene kann misslingen.
Warum diese Lücke?
ChatGPT und Gemini erzeugen ein Bild aus einer Beschreibung und einem Foto : Sie kennen die reale Geometrie des Produkts nicht, sie raten sie. Je spezifischer die Form (eine ungewöhnliche Beinanzahl, ein präziser Schwung, ein Verbindungsdetail), desto deutlicher zeigt sich die Abweichung vom echten Produkt.
Das KI-Fotostudio muss nichts raten : Das Produkt, das es zeigt, ist das von der Marke bereitgestellte 3D-Modell, unverändert gerendert. Die KI greift nur beim Hintergrund drumherum ein. Das ist auch der Unterschied zu den klassischen Halluzinationen generativer KI bei Produktvisuals, ein Thema, das wir bereits mit einem anderen Kunden dokumentiert hatten.
💡 Dieser Test zeigt eine reale Grenze, keinen zu behebenden Fehler. ChatGPT und Gemini sind nicht dafür gemacht, ein vorhandenes Produkt pixelgenau zu reproduzieren : Es sind Bildgeneratoren aus einer Beschreibung. Für ein Stimmungsvisual, das das Produkt nicht im Detail zeigt, kann das genügen. Für eine Produktseite entspricht das nicht dem, was der Kunde erhalten wird.
Die Grenzen dieses Tests
- Nur ein getestetes Produkt. Der Beluga-Stuhl hat eine spezifische Form (3 Beine), die die Abweichung leicht erkennbar macht ; ein Produkt mit klassischerer Form würde die Abweichung vielleicht weniger deutlich zeigen.
- 3 Versuche für ChatGPT und Gemini, nicht 8 Farben × 2 Hintergründe wie beim KI-Fotostudio : Die Formabweichung war schon bei den ersten Versuchen deutlich, wir hielten es nicht für nötig, sie für jedes Tool so oft zu wiederholen.
- Bewertung von uns selbst vorgenommen. Wir haben uns um Ehrlichkeit bemüht, sind aber kein neutraler Richter : Urteilen Sie auch selbst anhand der Bilder, die unretuschiert veröffentlicht werden.
Fazit
In diesem Test produzieren ChatGPT und Gemini schöne Bilder, aber nicht das verkaufte Produkt : einen Stuhl mit generischen 4 Beinen, in angenäherten Farben, während der Kunde eine Beluga mit 3 Beinen in einer der 8 echten Farben erhält. Das KI-Fotostudio reproduziert das exakte Produkt, weil es vom 3D-Modell ausgeht, statt es neu zu zeichnen, mit seinen eigenen, offen zugegebenen Grenzen bei der Platzierung im Hintergrund.
Wenn Ihr Produkt eine einfache Form hat und das Bild nur als allgemeine Stimmung dient, können ChatGPT oder Gemini ausreichen. Wenn das Bild das exakte Produkt zeigen muss, so wie es geliefert wird, muss man vom 3D-Modell ausgehen.
Häufige Fragen
Importieren Sie sie in die 3DVue-Software : 3D-Konfigurator 90 Tage kostenlos, ohne Kreditkarte, und KI-Fotostudio ab dem Tarif Starter.
Beschreiben Sie Ihr Projekt in 15 Minuten. Wir sagen Ihnen ehrlich, ob das 3DVue-Individualprojekt die richtige Lösung für Sie ist, oder nicht.
Entdecken Sie unsere Konfiguratoren nach Branche