// MLC SD v0.3.14 BETA
Bilder auf dem eigenen Rechner
// Galerie
// Vorteile
Was MLC SD auszeichnet.
Z-Image Turbo schreibt lesbare Wörter auf Schilder, Etiketten und Verpackungen – woran die meisten Bildmodelle bis heute scheitern.
Das empfohlene Modell ist auf Tempo destilliert, ein Schritt-Cache spart doppelte Arbeit. Rund 23 Sekunden je Bild in 1024×1024 auf einer RTX 3060.
Kein Konto, kein Upload, keine Telemetrie. Prompts und Bilder bleiben, wo sie entstehen.
Eines aus dem Katalog wählen, den Rest erledigt das Programm – mit Fortschrittsbalken und einer Auskunft, welche Dateien es braucht.
Ein lokaler Endpunkt unter /v1/images/generations. Jeder OpenAI-Client spricht damit ohne Umbau.
Jedes Bild landet im Ausgabeordner neben einer Markdown-Datei mit Prompt, Modell, Größe, Seed und Rechenzeit. Gleicher Seed, gleiches Bild.
Wie Ollama: nach 5 Minuten ohne Anfrage wird das Modell entladen, die nächste Anfrage lädt es in Sekunden wieder. Ollama und MLC SD teilen sich einen Rechner, ohne um den Speicher zu streiten.
NVIDIA-, AMD- oder Intel-Grafik wird beim Start erkannt, passende Engine und Profil gewählt. Was ein VAE ist, muss niemand wissen.
MLC SD ist eine Oberfläche für stable-diffusion.cpp. Sie nimmt dir die Arbeit ab, die zwischen „ich hätte gern ein Bild" und dem fertigen Bild liegt: das richtige Modell finden, seine drei bis vier Dateien von Hugging Face holen, die Engine mit den passenden Angaben starten. Prompt eintippen, Knopf drücken.
Kein Konto, kein Upload, keine Telemetrie. Was auf dem Rechner entsteht, bleibt dort.
Warum Z-Image Turbo
Das empfohlene Modell kann etwas, woran die meisten Bildmodelle bis heute scheitern: lesbaren Text ins Bild schreiben. Schilder, Etiketten, Verpackungen, Buchrücken — die Buchstaben ergeben Wörter statt Zierrat.
Dazu ist es auf Tempo destilliert: acht Rechenschritte statt der sonst üblichen zwanzig bis fünfzig. Seit 0.3.9 überspringt ein Schritt-Cache (EasyCache) Arbeit, die das Ergebnis kaum verändern würde. Auf einer RTX 3060 mit 12 GB braucht ein Bild in 1024×1024 rund 23 Sekunden; ein Unterschied zum Bild ohne Cache ist nicht zu sehen.
Was das Programm für dich erledigt
- Modelle holen. Eines aus dem Katalog wählen — das Programm lädt die Gewichte, den Textencoder und den Autoencoder, zeigt den Fortschritt und sagt, welche Dateien noch fehlen. Dateien, die mehrere Modelle teilen, werden nur einmal geladen.
- Die Engine richtig starten. Welche Schrittzahl, welcher Sampler, welche Bildgröße — das steht beim Modell. Wieviel Speicher wie aufgeteilt wird, steht im Hardwareprofil. Beides wird beim Start zusammengesetzt.
- Aufräumen, was verwirrt. Von elf Katalogeinträgen ist einer empfohlen. Die übrigen stehen hinter „weitere anzeigen", jeder mit einer Notiz, warum er es nicht ist — „ungetestet" ist eine bessere Auskunft als ein Eintrag, der kommentarlos fehlt.
Für Anwendungen: OpenAI-kompatibel
Im Hintergrund läuft ein lokaler Server mit der Schnittstelle, die OpenAI-Clients erwarten:
POST http://localhost:18081/v1/images/generations
{"prompt": "ein Leuchtturm im Sturm", "size": "1024x1024"}
Jedes Programm, das mit DALL·E sprechen kann, spricht damit auch mit deiner Grafikkarte — ohne Umbau, ohne Schlüssel, ohne Rechnung.
Als Bildserver für MLC Ollama Studio
MLC Ollama Studio nutzt genau diese Schnittstelle. Der Reiter Server in MLC SD zeigt die Adresse dafür samt Kopierknopf (nur echte Netzwerkkarten, keine Docker- oder WSL-Adapter). Unter Einstellungen → Server- & Modell-Konfiguration → Bild-API diese http://<rechner>:18081/v1 eintragen, Verbindung prüfen, aktivieren und openai/z-image-turbo wählen. Der Windows-Rechner mit der Grafikkarte rechnet dann die Batches für das ganze Netz. Beim ersten Serverstart fragt Windows einmal, ob der Server erreichbar sein darf – Private Netzwerke ankreuzen. Außerdem muss Windows das Netzwerk als Privat einstufen; bei Öffentlich erreichen andere Rechner ihn nicht.
Der Server gibt seinen Speicher frei, wenn er nicht gebraucht wird – nach 5 Minuten ohne Anfrage wird das Modell entladen (einstellbar, oder je Anfrage per keep_alive, genau wie bei Ollama); die nächste Anfrage lädt es in wenigen Sekunden wieder. Auf dem Mac oder unter Linux läuft er auf Wunsch auch als Dienst ohne Control Panel (install-service.sh im App-Bundle, systemd-Vorlage) – siehe doc/service.md.
Ein optionaler Zugriffsschlüssel (Reiter Server → Erzeugen) lässt nur Clients zu, die ihn als API-Schlüssel mitschicken – MLC Ollama Studio hat dafür ein Feld; der Rechner selbst braucht ihn nicht. Das Schließen des Control Panels beendet den Server, deshalb fragt es vorher nach und nennt Rechner, die kürzlich Bilder angefordert haben.
Jede Anfrage – auch die von anderen Rechnern und abgewiesene – steht in requests.log mit Zeit, Absender, Größe, Seed, Dauer und Prompt.
Was du brauchst
- Windows 10 oder 11, 64 Bit
- Grafik: am besten eine NVIDIA-Karte (RTX 3060 mit 12 GB: ~23 s je Bild; 8 GB sollten reichen). Neu in 0.3.10: AMD- und Intel-Grafik über Vulkan – getestet auf einer Radeon 780M (Ryzen 9 8945HS, 32 GB RAM): ~2,5 Minuten je Bild. Dafür braucht es einen aktuellen Grafiktreiber: mit AMD Adrenalin 24.7.1 (2024) bekommt die Grafik nur 256 MB und die Bilderzeugung bricht ab; mit dem aktuellen 10 GB, ohne BIOS-Änderung.
- Rund 8 GB Plattenplatz: 446 MB für das Programm, etwa 6,7 GB für die Modellgewichte. Beim ersten Start bietet die Startseite sie mit einem Klick an – vorher Größe, geschätzte Dauer und Platzprüfung, dann Fortschritt, Tempo und Restzeit. Bei einer üblichen Leitung rund 20 Minuten.
Auf dem Mac: Apple Silicon (M1 oder neuer), macOS 12 oder neuer. Die Grafik steckt im Chip und teilt sich dessen Speicher. Getestet auf einem M2 Ultra: rund 52 Sekunden je Bild in 1024×1024. Macs mit 16 GB bekommen automatisch ein sparsameres Profil (ungetestet). Die DMG ist signiert und notarisiert – sie öffnet ohne Warnung.
Notfall ohne passende Grafik: das Programm startet trotzdem und rechnet auf dem Prozessor (Profil cpu-only) — dann dauert ein Bild Minuten bis eine Viertelstunde. Gut zum Ausprobieren.
Was noch fehlt
Das hier ist eine Beta, und sie ist ehrlich gemeint:
- Eine laufende Berechnung lässt sich nicht wirklich anhalten. „Abbrechen" beendet das Warten; die Engine rechnet das Bild zu Ende.
- Der Installer ist nicht signiert. Windows warnt beim ersten Start.
- Getestet auf zwei Windows-Rechnern: RTX 3060 12 GB (Update, Deinstallation, Neuinstallation) und Radeon 780M (Neuinstallation, Update).
Das Titelbild dieser Seite ist mit MLC SD erzeugt — Z-Image Turbo Q4_K, acht Schritte, 41 Sekunden auf einem Mac Studio.