Das Problem
Computer verstehen die Bedeutung von Wörtern nicht von sich aus.
- Für den Rechner ist Text nur eine Zeichenkette
- „Auto“ und „Wagen“ sind für ihn völlig verschieden
- Für Suche und Vergleich braucht es Bedeutung
Was ist ein Embedding?
Ein Embedding übersetzt Text in einen Vektor – eine Liste von Zahlen, die Bedeutung kodiert.
- Ähnliche Bedeutung → ähnliche Zahlen
- Erzeugt von einem eigenen KI-Modell
- Grundlage für semantische Suche
Die Landkarten-Analogie
Stell dir eine Landkarte der Bedeutungen vor.
- Ähnliche Begriffe liegen nah beieinander
- Tiere in einer Ecke, Fahrzeuge in einer anderen
- Der Abstand misst die Ähnlichkeit
Vektordatenbanken
Vektordatenbanken speichern Embeddings und finden blitzschnell die ähnlichsten.
- Optimiert für Nächste-Nachbar-Suche
- Basis vieler RAG-Systeme
Wie ein Embedding entsteht
Ein spezielles Modell übersetzt Text in eine Liste von Zahlen (Vektor).
- Typisch mehrere hundert bis tausend Dimensionen
- Ähnliche Bedeutung → ähnliche Zahlen → geringe Distanz
- Gleiches Modell für Speichern und Suchen verwenden
Chunking – Texte aufteilen
Lange Dokumente werden vor dem Einbetten in Häppchen zerlegt.
Zu groß
Vektor wird unscharf – die Suche trifft schlechter.
Zu klein
Zusammenhang geht verloren – Antworten wirken zerstückelt.
Praxis: mittelgroße Chunks mit etwas Überlappung liefern meist die besten Treffer.