Boris Agatić · · 9 Min. Lesezeit

Embeddings & Vektorsuche 2026: der stille Motor hinter RAG und KI-Gedächtnis

Fast jedes nützliche KI-System, das Sie dieses Jahr genutzt haben — ein Chatbot, der aus den Dokumenten Ihres Unternehmens antwortet, ein Support-Tool, das das richtige alte Ticket findet, ein Agent, der sich an ein Gespräch von letzter Woche erinnert — läuft auf derselben unscheinbaren Schicht darunter: Embeddings und Vektorsuche. Es ist der Teil, den niemand vorführt, und der Teil, der still darüber entscheidet, ob sich Ihr RAG-System wie Magie oder wie kaputt anfühlt. Dies ist ein Leitfaden in klarer Sprache dazu, was Embeddings sind, wie Vektorsuche funktioniert und welche Entscheidungen 2026 eine funktionierende Abrufschicht von einer trennen, die selbstbewusst Unsinn zurückgibt.

Was ein Embedding eigentlich ist

Ein Embedding ist eine Möglichkeit, ein Stück Text — einen Satz, einen Absatz, einen ganzen Dokumentabschnitt — in eine Zahlenliste, einen Vektor, zu verwandeln, die seine Bedeutung erfasst. Ein modernes Embedding-Modell liest „Wie setze ich mein Passwort zurück?" und gibt einige hundert bis einige tausend Zahlen aus. Der Trick: Texte mit ähnlicher Bedeutung landen in diesem Raum nahe beieinander, selbst wenn sie kein Wort teilen. „Passwort zurücksetzen" und „Ich habe meine Anmeldedaten vergessen" liegen nah beieinander; „Passwort zurücksetzen" und „Router auf Werkseinstellungen zurücksetzen" liegen weiter auseinander. Das ist die ganze Idee: Bedeutung wird zu Geometrie, und sobald Bedeutung Geometrie ist, kann ein Computer sie nach Distanz durchsuchen.

256–4096
typische Dimensionen pro Embedding-Vektor in Produktionsmodellen 2026
~1 ms
um Millionen Vektoren mit einem guten Näherungsindex zu durchsuchen
2
Abrufsignale, die man kombinieren sollte: semantisch (Vektoren) + Stichwort (BM25)

Von Text zu Antwort: die Abrufschleife

In einem typischen Stack von 2026 ist der Ablauf gleich, ob Sie ein Helpdesk oder das Langzeitgedächtnis eines Agenten bauen:

  1. Chunken & einbetten. Teilen Sie Dokumente in Passagen, führen Sie jede durch ein Embedding-Modell und speichern Sie die entstehenden Vektoren in einer Vektordatenbank. Das tun Sie einmal, im Voraus.
  2. Anfrage einbetten. Wenn ein Nutzer etwas fragt, betten Sie die Frage mit demselben Modell ein.
  3. Nach Distanz suchen. Finden Sie die gespeicherten Vektoren, die dem Anfragevektor am nächsten sind — meist per Kosinus-Ähnlichkeit — und geben Sie die besten Passagen zurück.
  4. Antwort verankern. Übergeben Sie diese Passagen dem Sprachmodell als Kontext, damit es aus Ihren Daten antwortet statt aus seinem Gedächtnis.

Jedes Versagen, das Leute „der KI-Halluzination" zuschreiben, passiert meist in Schritt 3. Wurde die richtige Passage nie abgerufen, bekam das Modell nie die Chance, richtig zu liegen.

Eine Dimension wählen: größer ist nicht automatisch besser

Embedding-Modelle erlauben es, Vektorgröße gegen Kosten und Geschwindigkeit abzuwägen. Ein höherdimensionaler Vektor kann feinere Unterschiede erfassen, kostet aber mehr Speicher, mehr Arbeitsspeicher im Index und mehr Vergleichszeit. 2026 unterstützen viele Modelle verkürzte Embeddings (durch Matryoshka-artiges Training) — Sie können die ersten 512 eines 1536-dimensionalen Vektors behalten und verlieren erstaunlich wenig Genauigkeit. Der Sweet Spot für die meiste Unternehmenssuche ist kleiner, als Teams annehmen: die Abrufqualität flacht deutlich vor der Maximaldimension ab, während die Speicherkosten linear weiter steigen.

Abrufqualität vs. Speicherkosten nach Embedding-Dimension (illustrativ)

Vektordatenbanken und der Geschwindigkeitstrick

Eine Anfrage mit Millionen Vektoren einzeln zu vergleichen, wäre für ein Live-Produkt viel zu langsam. Vektordatenbanken lösen das mit Indizes für approximative nächste Nachbarn (ANN) — Strukturen wie HNSW, die die nächsten Vektoren finden, ohne jeden zu prüfen, und dabei ein winziges, einstellbares Maß an Genauigkeit gegen einen enormen Geschwindigkeitsgewinn tauschen. Das Ergebnis ist eine Suche im Submillisekundenbereich über Millionen Einträge. Die praktische Entscheidung lautet weniger „welche Datenbank ist am besten", sondern „verwaltet oder selbst gehostet": ein verwalteter Vektordienst nimmt Betriebslast ab, ein selbst gehosteter Index gibt Kontrolle über den Datenstandort — wichtig für Teams unter EU-Datenregeln.

EntscheidungOption AOption BFaustregel
Wo betreibenVerwalteter VektordienstSelbst gehostet (HNSW / pgvector)Verwaltet, sofern nicht Datenstandort oder Kosten im großen Maßstab Selbsthosting erzwingen
VektorgrößeVolle DimensionVerkürzt (512–768)Verkürzt beginnen; nur wachsen, wenn Recall-Tests es verlangen
SuchartRein vektoriellHybrid (Vektor + Stichwort)Hybrid gewinnt bei den meisten realen Korpora mit Namen, Codes, Akronymen
Nach der SucheTop-k unverändertTop-k rerankenReranker hinzufügen, wenn Präzision der Top-3-Ergebnisse zählt

Warum reine Vektorsuche nicht reicht: hybrid + Reranking

Semantische Suche ist brillant bei Bedeutung und überraschend schlecht bei exakten Zeichenketten. Fragen Sie nach Rechnung „INV-2026-0847" oder Produktcode „X‑42B", gibt ein Vektormodell munter semantisch ähnliche, aber falsche Treffer zurück, weil diese Codes keine einbettbare Bedeutung tragen. Der Standard 2026 ist die hybride Suche: klassische Stichwortsuche (BM25) und Vektorsuche parallel ausführen und die Ergebnisse zusammenführen. Stichwörter fangen die exakten Tokens; Vektoren fangen die Umschreibungen. Darüber hinaus schärft ein Reranker — ein kleines Modell, das die besten Kandidaten gegen die Anfrage neu bewertet — die Präzision der wenigen Passagen dramatisch, die Sie dem Modell tatsächlich übergeben.

Abrufgenauigkeit nach Methode (illustrativ, höher ist besser)
Chunking entscheidet still über Erfolg oder Scheitern der meisten Projekte. Wie Sie Dokumente vor dem Einbetten teilen, zählt genauso viel wie die Modellwahl. Zu große Chunks vergraben den relevanten Satz im Rauschen; zu kleine verlieren den Kontext, der sie erst sinnvoll machte. Teilen Sie an natürlichen Grenzen — Überschriften, Absätzen, Abschnitten — halten Sie etwas Überlappung, damit grenzüberschreitende Ideen nicht halbiert werden, und speichern Sie Metadaten (Quelle, Datum, Abschnitt) neben jedem Vektor, um filtern und zitieren zu können. Gutes Chunking schlägt ein edleres Embedding-Modell weit öfter, als Teams erwarten.

Was der Betrieb kostet

Embeddings gehören zu den günstigsten Teilen eines KI-Stacks — pro Token um Größenordnungen billiger als die Generierung — doch die Kosten sind im großen Maßstab real und leicht zu übersehen. Sie zahlen fürs einmalige Einbetten Ihres Korpus (und erneut bei jeder Neuindizierung oder jedem Modellwechsel), fürs Einbetten jeder eingehenden Anfrage sowie fürs Speichern und Ausliefern der Vektoren im Arbeitsspeicher. Der Fehlermodus ist keine schockierende Rechnung; es ist das wiederholte Neu-Einbetten eines großen Korpus, weil niemand festgehalten hat, welches Modell und welche Version die bestehenden Vektoren erzeugt haben. Wählen Sie das Embedding-Modell bewusst, fixieren Sie die Version und behandeln Sie einen Modellwechsel als Migration.

Richtig machen: eine kurze Checkliste

  1. Überall ein Embedding-Modell nutzen. Anfragen und Dokumente müssen mit demselben Modell und derselben Version eingebettet werden, sonst passt die Geometrie nicht.
  2. Standardmäßig hybrid suchen. Stichwort und Vektor kombinieren, sofern Sie nicht belegt haben, dass rein vektoriell für Ihre Daten reicht.
  3. Nach Bedeutung chunken, Metadaten behalten. Natürliche Grenzen, leichte Überlappung sowie Quell-/Datumsfelder zum Filtern und Zitieren.
  4. Reranker hinzufügen, wenn Präzision zählt. Das ist das wirksamste Upgrade bei Klagen „die beste Antwort ist falsch".
  5. Recall mit einem echten Testset messen. Bauen Sie ein kleines Set aus Frage→richtige-Passage-Paaren und verfolgen Sie, ob der Abruf sie findet. Man kann nicht verbessern, was man nicht misst.

Fazit

Embeddings und Vektorsuche sind die Schicht, die einen Stapel Dokumente in etwas verwandelt, worüber eine KI schlussfolgern kann — das Fundament unter RAG, semantischer Suche, Empfehlungen und Agentengedächtnis gleichermaßen. 2026 sind die Modelle günstig und die Datenbanken schnell, der Vorteil kommt also nicht mehr vom edelsten Embedding-Modell. Er kommt von den langweiligen Entscheidungen: sinnvolles Chunking, hybride Suche, ein Reranker dort, wo Präzision zählt, und ein ehrlicher Recall-Test als Beweis. Machen Sie die Abrufschicht richtig, wirkt das Modell darüber brillant. Machen Sie sie falsch, rettet kein noch so gutes Prompt-Engineering die Antwort.

Bauen Sie eine Abrufschicht, der Sie vertrauen können

Wir helfen Teams, semantische Suche und RAG durchgängig zu gestalten und abzustimmen — Embedding-Modell und Dimension, Chunking, hybride Suche, Reranking und Recall-Tests — über Anthropic, OpenAI, Mistral und selbst gehostete Stacks, mit für EU-Anforderungen geregeltem Datenstandort.

Mit einem KI-Berater sprechen