← Übersicht

Tastenkürzel

Nächste Folie
Vorherige Folie
ESC Zurück zur Übersicht
F Vollbild
? Diese Hilfe
Lernportal

Multimodale KI

🎧 Artikel anhören

Wenn KI mehr als nur Text versteht

Was bedeutet multimodal?

Ein multimodales KI-Modell kann mehrere Eingangs- und Ausgangstypen verarbeiten – nicht nur Text, sondern auch Bilder, Audio, Video und Dokumente.

„Multimodal" = viele Modalitäten (Sinneskanäle) in einem Modell vereint.

Eingabetypen im Überblick

Text Basismodalität Natürlichsprachliche Eingaben, Prompts, Code, strukturierte Daten (JSON, CSV) – alle Modelle unterstützen Text
Bild Screenshots, Fotos, Diagramme KI erkennt Objekte, liest Text aus Bildern (OCR), analysiert Diagramme und Fehlermeldungen im Screenshot
Audio Sprache, Töne Sprachbefehle, Meetings transkribieren, Tonhöhe und Emotion erkennen – GPT-4o nativ, andere via Whisper
Video Bewegtbild + Ton Szenen analysieren, Bildschirmaufnahmen auswerten – Gemini 1.5 Pro führend, andere Modelle eingeschränkt
PDF / Dokumente Lange Dokumente Handbücher, Protokolle, Berichte direkt hochladen – KI liest, fasst zusammen und beantwortet Fragen dazu
Code & Daten Spezialfall Text Quellcode, Konfigurationsdateien, Logs – alle Modelle verarbeiten Code nativ als Text-Modalität

GPT-4o – Multimodale Fähigkeiten

Stärken Nativ multimodal Text + Bild in einem Modell (kein separater Vision-Endpoint).

Echtzeit-Audio: Gespräch mit natürlicher Stimme, Unterbrechungen möglich.

Bildgenerierung via DALL·E 3 direkt in ChatGPT integriert.

Code Interpreter: CSV hochladen → Diagramm erstellen lassen.
Einschränkungen Was fehlt Video-Input noch nicht in der API (Stand 2025).

Audio-API (Speech-to-Speech) nur über Realtime-API – komplex zu integrieren.

Bildausgabe via DALL·E, nicht nativ im Modell.

Kontextfenster bei langen Dokumenten begrenzt.

Claude 3 – Multimodale Fähigkeiten

Stärken Bild + langes Dokument 200.000 Token Kontextfenster: Ganze Handbücher oder Codebases auf einmal.

Exzellente Bildanalyse: Screenshots, Diagramme, handgeschriebene Notizen.

Besonders stark bei: Dokumente zusammenfassen, strukturieren, extrahieren.

PDF-Upload direkt in Claude.ai.
Einschränkungen Was fehlt Kein nativer Audio-Input (kein Sprach-Chat).

Kein Video-Input.

Keine Bildgenerierung.

Stärke liegt bei Text und Bildanalyse – nicht bei Medienerzeugung.

Gemini – Multimodale Fähigkeiten

Stärken Video & natives Multimodal Einziges Modell mit nativem Video-Input in der API (Gemini 1.5 Pro).

1 Million Token Kontext: Stundenlange Videos, riesige Codebasen.

Google-Integration: YouTube, Google Drive, Gmail, Workspace.

Bildgenerierung via Imagen 3 integriert.
Einschränkungen Was zu beachten ist Konsistenz bei komplexen Texten schwächer als GPT-4o / Claude.

API-Latenz bei großen Kontexten spürbar.

Datenschutz: Google verarbeitet Daten – relevant für Unternehmenseinsatz.

Qualität der Antworten variiert je nach Gemini-Version.

IT-Praxis: Server-Fehlerbild analysieren

Szenario: Ein Server zeigt einen blauen Bildschirm (BSOD) oder ein kritisches Fehlerfenster. Statt abzutippen – Screenshot machen und hochladen.

Prompt + Screenshot-Upload:

„Analysiere diesen Screenshot. Was ist die Fehlerursache? Welche Schritte empfiehlst du zur Behebung? System: Windows Server 2022."

IT-Praxis: Netzwerkdiagramm einlesen

Szenario: Ein bestehendes Netzwerkdiagramm (Visio-Export, Foto, PNG) soll analysiert oder dokumentiert werden.

Prompt + Diagramm-Upload:

„Lies dieses Netzwerkdiagramm. Identifiziere alle Segmente, Geräte und Verbindungen. Erstelle eine strukturierte Übersicht als Tabelle: Gerät | Typ | Segment | IP-Bereich."

Grenzen der multimodalen KI

Multimodal bedeutet mehr Fähigkeiten – aber auch mehr Verantwortung beim Datenschutz.

Zusammenfassung

Ein Bild sagt mehr als tausend Worte – und die KI liest es mit.
Nächstes Kapitel

Fine-Tuning

Eigene Modelle trainieren – wann es sich lohnt und wann nicht