
Wie wir ein Bildmodell auf unser eigenes Logo angelernt haben — auf eigener Hardware, ohne Cloud. Aufbau, Datenschutz, Grenzen und was das wirklich kostet.

AIJedes Bild in diesem Beitrag ist auf einem Rechner entstanden, der bei uns im Haus steht. Kein Upload, kein API-Key, kein Nutzungsrecht, das in fremden AGB geregelt wird. Wir haben ein offenes Bildmodell auf unser eigenes Logo angelernt und lassen es seitdem lokal laufen — KI ohne Cloud, im Wortsinn.
Das ist keine Prinzipienreiterei. Wer mit Industriekunden arbeitet, bekommt Datenräume anvertraut, in denen ein einzelner CAD-Schnitt mehr wert ist als das ganze Projektbudget. Wenn wir intern selbstverständlich Material in fremde Rechenzentren schieben, ist unser Versprechen an diese Kunden wenig wert.
Hier steht, wie unser Aufbau aussieht, wie aus einem Logo ein Bild wird, was das rechtlich bedeutet — und wo die Grenzen liegen.
KI ohne Cloud heißt: Modell, Rechenleistung und Daten liegen auf eigener Hardware. Ein Bild entsteht vollständig im eigenen Netz, ohne dass Prompt, Referenzmaterial oder Ergebnis je einen fremden Server erreichen. Der Fachbegriff dafür ist On-Premise-KI — im Unterschied zum gehosteten Dienst, bei dem jede Anfrage eine Übermittlung an einen Dritten ist.
Der Unterschied klingt nach einer Frage des Hostings. Er ist eine Frage der Verantwortung.
| Gehosteter KI-Dienst | KI auf eigener Hardware | |
|---|---|---|
| Wo die Daten liegen | beim Anbieter, oft im Drittland | im eigenen Netz |
| Rechtlicher Rahmen | Auftragsverarbeitung, ggf. Prüfung des Drittlandtransfers | keine Übermittlung, keine Auftragsverarbeitung |
| Kosten | laufend, pro Bild oder Token | einmalig Hardware, laufend Strom |
| Modellwechsel | der Anbieter entscheidet | wir entscheiden |
| Reproduzierbarkeit | Modell kann sich unangekündigt ändern | dieselbe Version liefert dasselbe Ergebnis |
| Aufwand | gering | Einrichtung, Pflege, Know-how |
Die letzte Zeile ist die ehrliche. On-Premise ist nicht billiger und nicht bequemer. Es ist kontrollierbar.
Der Aufbau ist bewusst klein gehalten. Es braucht kein Rechenzentrum, um Bilder zu erzeugen.
Bildgenerierung ist speicherhungrig, nicht kernhungrig — entscheidend ist der Videospeicher, nicht die Zahl der Karten.
Die heutige Generation baut auf dem Prinzip der latenten Diffusion auf: Das Modell rechnet nicht im Pixelraum, sondern in einem komprimierten Zwischenraum. Genau deshalb passt es überhaupt auf eine einzelne GPU.
Wir arbeiten mit ComfyUI, weil dort jeder Bildaufbau ein sichtbarer Graph ist. Ein Graph lässt sich versionieren, weitergeben und ein halbes Jahr später erneut ausführen. Ein Prompt im Chatfenster lässt sich das nicht.
Der dritte Punkt ist der, den wir unterschätzt hatten. Reproduzierbarkeit ist der eigentliche Gewinn des eigenen Servers — noch vor dem Datenschutz. Wenn eine Kampagne ein Jahr später eine Ergänzung braucht, liegt das Rezept vor, nicht nur das Ergebnis.
So läuft eine Bildstrecke bei uns ab:
Wortmarke, Signet, Farbraum, bestehende Keyvisuals. Alles, was die Marke bereits sagt.
Wenige Dutzend Bilder reichen, wenn sie sauber beschriftet sind. Die Qualität der Bildunterschriften schlägt die Menge deutlich.
Wir trainieren kein eigenes Modell, sondern eine kleine Adapterschicht darauf — das Verfahren heißt LoRA und verändert nur einen Bruchteil der Gewichte. Das Training dauert Stunden, nicht Wochen, und die Datei ist klein genug, um sie wie ein Asset zu behandeln.
Der unromantische Teil. Von hundert Bildern überleben wenige, und das Aussortieren ist Gestaltungsarbeit, keine Rechenarbeit.
Freistellen, Farben auf die echten Markenwerte ziehen, Retusche. Kein Bild sollte ungeprüft raus gehen.
Der übliche Weg zum Datenschutz bei KI-Diensten führt über Verträge: Auftragsverarbeitung nach Art. 28 DSGVO, Prüfung des Drittlandtransfers, Löschkonzept, Vertrauen auf Vertragstreue. Das ist ein gangbarer Weg, und für viele Anwendungen ist er der richtige.
Nur: Er regelt eine Übermittlung, die stattfindet. Auf eigener Hardware findet sie nicht statt. Was das Haus nicht verlässt, muss nicht vertraglich zurückgeholt werden.
Zwei Punkte gehören dazu, damit das Bild vollständig ist:
Der interessanteste Teil der Reise war der, bei dem wir am meisten falsch lagen.
Unsere Erwartung: Wir zeigen dem Modell Logo, Farben und Tonalität, und es liefert Markenbilder. Was tatsächlich passiert ist: Ein Bildmodell lernt Formen und Stimmungen zuverlässig — Farben und Typografie so gut wie gar nicht.
Tonalität ist der Punkt, an dem die Zuständigkeit endgültig bei uns bleibt. Ein Modell kann eine Bildwelt fortschreiben. Es kann nicht entscheiden, wie wir klingen wollen. Wie wir über den Einsatz von KI im gestalterischen Alltag denken, steht ausführlicher in KI im Kreativprozess — inklusive der Stellen, an denen wir sie wieder ausgebaut haben.
Vier Einschränkungen, die wir jedem Kunden vor der ersten Rechnung nennen:
Wir stehen am Anfang. Die nächsten Schritte sind absehbar: bewegte Keyvisuals statt Standbilder, ein gepflegter Bildbestand statt einzelner Kampagnen-Assets, und die Verbindung zum Rest unseres Stacks — ein generiertes Motiv, das direkt im Headless CMS landet, ist deutlich mehr wert als eines, das in einem Ordner liegt.
statt sie einzukaufen? Sprechen Sie mit uns — wir schätzen ehrlich ein, was sich lohnt und was nicht.