Was bedeutet multimodal?
Ein multimodales KI-Modell kann mehrere Eingangs- und Ausgangstypen verarbeiten – nicht nur Text, sondern auch Bilder, Audio, Video und Dokumente.
„Multimodal" = viele Modalitäten (Sinneskanäle) in einem Modell vereint.
- Früher: Separate Modelle für Sprache, Bild, Ton – kein gemeinsamer Kontext
- Heute: Ein Modell versteht Text, Bild und Ton gleichzeitig – im selben Gespräch
- Vorteil: KI kann Zusammenhänge zwischen verschiedenen Datentypen erkennen
- Beispiel: Ein Screenshot zeigen + eine Frage dazu stellen – ohne Umweg
Eingabetypen im Überblick
Text
Basismodalität
Natürlichsprachliche Eingaben, Prompts, Code, strukturierte Daten (JSON, CSV) – alle Modelle unterstützen Text
Bild
Screenshots, Fotos, Diagramme
KI erkennt Objekte, liest Text aus Bildern (OCR), analysiert Diagramme und Fehlermeldungen im Screenshot
Audio
Sprache, Töne
Sprachbefehle, Meetings transkribieren, Tonhöhe und Emotion erkennen – GPT-4o nativ, andere via Whisper
Video
Bewegtbild + Ton
Szenen analysieren, Bildschirmaufnahmen auswerten – Gemini 1.5 Pro führend, andere Modelle eingeschränkt
PDF / Dokumente
Lange Dokumente
Handbücher, Protokolle, Berichte direkt hochladen – KI liest, fasst zusammen und beantwortet Fragen dazu
Code & Daten
Spezialfall Text
Quellcode, Konfigurationsdateien, Logs – alle Modelle verarbeiten Code nativ als Text-Modalität
GPT-4o – Multimodale Fähigkeiten
Stärken
Nativ multimodal
Text + Bild in einem Modell (kein separater Vision-Endpoint).
Echtzeit-Audio: Gespräch mit natürlicher Stimme, Unterbrechungen möglich.
Bildgenerierung via DALL·E 3 direkt in ChatGPT integriert.
Code Interpreter: CSV hochladen → Diagramm erstellen lassen.
Einschränkungen
Was fehlt
Video-Input noch nicht in der API (Stand 2025).
Audio-API (Speech-to-Speech) nur über Realtime-API – komplex zu integrieren.
Bildausgabe via DALL·E, nicht nativ im Modell.
Kontextfenster bei langen Dokumenten begrenzt.
Claude 3 – Multimodale Fähigkeiten
Stärken
Bild + langes Dokument
200.000 Token Kontextfenster: Ganze Handbücher oder Codebases auf einmal.
Exzellente Bildanalyse: Screenshots, Diagramme, handgeschriebene Notizen.
Besonders stark bei: Dokumente zusammenfassen, strukturieren, extrahieren.
PDF-Upload direkt in Claude.ai.
Einschränkungen
Was fehlt
Kein nativer Audio-Input (kein Sprach-Chat).
Kein Video-Input.
Keine Bildgenerierung.
Stärke liegt bei Text und Bildanalyse – nicht bei Medienerzeugung.
Gemini – Multimodale Fähigkeiten
Stärken
Video & natives Multimodal
Einziges Modell mit nativem Video-Input in der API (Gemini 1.5 Pro).
1 Million Token Kontext: Stundenlange Videos, riesige Codebasen.
Google-Integration: YouTube, Google Drive, Gmail, Workspace.
Bildgenerierung via Imagen 3 integriert.
Einschränkungen
Was zu beachten ist
Konsistenz bei komplexen Texten schwächer als GPT-4o / Claude.
API-Latenz bei großen Kontexten spürbar.
Datenschutz: Google verarbeitet Daten – relevant für Unternehmenseinsatz.
Qualität der Antworten variiert je nach Gemini-Version.
IT-Praxis: Server-Fehlerbild analysieren
Szenario: Ein Server zeigt einen blauen Bildschirm (BSOD) oder ein kritisches Fehlerfenster. Statt abzutippen – Screenshot machen und hochladen.
Prompt + Screenshot-Upload:
„Analysiere diesen Screenshot. Was ist die Fehlerursache? Welche Schritte empfiehlst du zur Behebung? System: Windows Server 2022."
- KI liest Fehlercodes direkt aus dem Bild – kein Abtippen nötig
- Erkennt STOP-Codes, Event-IDs, Fehlermeldungen aus dem Screenshot
- Kombiniert Bildinhalt mit Systemkontextinformation aus dem Prompt
- Spart Zeit und verhindert Tippfehler bei langen Fehlercodes
IT-Praxis: Netzwerkdiagramm einlesen
Szenario: Ein bestehendes Netzwerkdiagramm (Visio-Export, Foto, PNG) soll analysiert oder dokumentiert werden.
Prompt + Diagramm-Upload:
„Lies dieses Netzwerkdiagramm. Identifiziere alle Segmente, Geräte und Verbindungen. Erstelle eine strukturierte Übersicht als Tabelle: Gerät | Typ | Segment | IP-Bereich."
- KI erkennt Router, Switches, Firewalls, Server aus grafischen Symbolen
- Liest IP-Adressen und Labels direkt aus dem Diagramm
- Ausgabe: strukturierte Tabelle – sofort verwendbar für Dokumentation
- Auch möglich: Sicherheitslücken oder fehlende Segmentierung identifizieren
Grenzen der multimodalen KI
- Halluzinationen auch bei Bildern: KI „sieht" manchmal Details, die nicht vorhanden sind – immer prüfen
- Bildqualität entscheidend: Unscharfe, zu kleine oder schlecht belichtete Bilder werden schlecht erkannt
- Kein echtes Sehen: KI beschreibt statistische Muster – kein Verständnis wie ein Mensch
- Datenschutz: Bildschirmfotos können sensible Daten enthalten – nie interne Daten zu Drittanbietern hochladen
- Kosten: Bild-Token kosten mehr als Text-Token – große Bilder erhöhen den API-Preis spürbar
- Audio/Video noch eingeschränkt: Nativ nur bei GPT-4o (Audio) und Gemini (Video) – andere via Umwege
Multimodal bedeutet mehr Fähigkeiten – aber auch mehr Verantwortung beim Datenschutz.
Zusammenfassung
- Multimodale KI verarbeitet Text, Bild, Audio, Video und Dokumente in einem Modell
- GPT-4o: stark bei Audio und Bild; Claude 3: stark bei langen Dokumenten und Bildanalyse; Gemini: führend bei Video und Kontext
- IT-Praxis: Screenshots und Diagramme direkt hochladen spart Zeit und verhindert Fehler
- Grenzen: Halluzinationen, Bildqualität, Datenschutz bei sensiblen Inhalten
- Multimodal ist kein Gimmick – es eröffnet echte Workflow-Verbesserungen im IT-Alltag
Ein Bild sagt mehr als tausend Worte – und die KI liest es mit.