Suche

Wonach suchen Sie?

Durchsuchen Sie Leistungen, Anwendungsfälle und unser Praxiswissen.

Mindestens 2 Zeichen eingeben

Beliebte Einstiege

Wissen, Daten und RAG

Was sind Embeddings und Vektordatenbanken?

Embeddings übersetzen Inhalte in Zahlenvektoren, sodass ein System nach ähnlicher Bedeutung suchen kann. Eine Vektordatenbank speichert und durchsucht diese Repräsentationen effizient.

Die kurze Antwort

Ein Embedding ist eine numerische Repräsentation eines Inhalts, bei der semantisch ähnliche Inhalte im Vektorraum näher beieinanderliegen. Eine Vektordatenbank speichert solche Vektoren zusammen mit Inhalt und Metadaten und findet ähnliche Einträge.

Kurz zusammengefasst

  • Embeddings bilden Bedeutung als Zahlenfolgen ab; sie enthalten nicht den lesbaren Originaltext.
  • Vektorsuche findet sinngleiche Passagen auch ohne identische Suchbegriffe.
  • Eine Vektordatenbank ersetzt weder die Originalquelle noch Berechtigungen und Aktualitätsregeln.
  • Gute Suche kombiniert häufig Vektoren, Schlüsselwörter, Metadatenfilter und anschliessendes Ranking.

Wie wird aus einem Text ein Embedding?

Ein Embedding-Modell erhält einen Textabschnitt, ein Bild oder einen anderen unterstützten Inhalt und erzeugt daraus eine feste Zahlenfolge. Für eine Suchanfrage wird dasselbe Verfahren verwendet. Ein Ähnlichkeitsmass vergleicht anschliessend Anfrage- und Dokumentvektoren.

  1. Schritt 1

    Inhalte aufteilen

    Dokumente werden in sinnvolle, ausreichend kontextreiche Abschnitte zerlegt.

  2. Schritt 2

    Vektoren erzeugen

    Ein Embedding-Modell berechnet für jeden Abschnitt eine numerische Repräsentation.

  3. Schritt 3

    Mit Metadaten speichern

    Quelle, Titel, Version, Sprache und Rechte bleiben mit dem Abschnitt verknüpft.

  4. Schritt 4

    Ähnlichkeit suchen

    Die Anfrage wird eingebettet und mit gespeicherten Vektoren verglichen.

Was leistet eine Vektordatenbank?

Eine Vektordatenbank oder ein Suchindex optimiert die Suche über sehr viele hochdimensionale Vektoren. Sie liefert Kandidaten zurück, die semantisch zur Anfrage passen, und kann diese anhand von Metadaten einschränken. Der gespeicherte Originalabschnitt wird für Anzeige und Modellkontext weiterhin benötigt.

  • Schnelle Ähnlichkeitssuche über grosse Inhaltsmengen
  • Filter nach Sprache, Produkt, Gültigkeit oder Nutzerrecht
  • Verknüpfung zum lesbaren Original und seiner Fundstelle
  • Aktualisierung und Löschung von Vektoren bei Quellenänderungen

Wovon hängt die Suchqualität ab?

Ein Embedding allein macht eine Suche nicht gut. Abschnittsgrösse, Überschriften, Metadaten, Sprache und die Art der Anfrage beeinflussen das Resultat. Die drei Suchansätze lösen unterschiedliche Probleme und sollten mit denselben realen Fragen verglichen werden.

Wovon hängt die Suchqualität ab?
SuchansatzBeispielBesondere StärkeTypischer Fehlertyp
Schlüsselwortsuche«Fehlercode E-417» findet genau diese Zeichenfolge.Produktcodes, Namen, Fachbegriffe und exakte FormulierungenVerpasst eine Passage, die denselben Inhalt mit anderen Worten beschreibt.
Vektorsuche«Arbeiten aus dem Ausland» findet «temporäre grenzüberschreitende Tätigkeit».Bedeutungsähnliche Fragen, Umschreibungen und natürliche SpracheLiefert einen thematisch ähnlichen, aber fachlich nicht passenden Spezialfall.
Hybride Suche«E-417 bei Auslandseinsatz» kombiniert Code-Treffer und semantischen Kontext.Exakte Signale und Bedeutungsnähe gemeinsam gewichtenSchlechte Gewichtung verdrängt den exakten Treffer oder überbewertet ein Schlagwort.

Welche Grenzen und Sicherheitsfragen gibt es?

Ein Vektor ist keine sichere Anonymisierung. Er wurde aus Inhalt abgeleitet und muss entsprechend geschützt werden. Zugriffsrechte dürfen nicht erst nach der Suche geprüft werden, wenn unzulässige Passagen bereits an ein Modell gelangt sind. Auch ein hoher Ähnlichkeitswert beweist keine fachliche Richtigkeit.

  • Embeddings und Originalinhalte nach derselben Schutzlogik behandeln
  • Berechtigungsmetadaten beim Indexieren übernehmen und bei der Suche erzwingen
  • Modellwechsel und neue Vektordimensionen als Migration planen
  • Trefferqualität, fehlende Treffer und falsche Treffer getrennt evaluieren
Beispiel aus dem Unternehmensalltag

Beispiel: Suche nach einer anders formulierten Richtlinie

Eine Mitarbeitende fragt: «Wie lange darf ich im Ausland arbeiten?» Die Richtlinie verwendet den Begriff «temporäre grenzüberschreitende Tätigkeit». Eine reine Wortsuche findet möglicherweise nichts; Vektorsuche erkennt die Bedeutungsnähe. Metadaten begrenzen die Treffer auf das gültige Land und die berechtigte Nutzergruppe. Die Antwort zeigt die Originalpassage mit Versionsdatum.

Was Sie mitnehmen sollten

Nutzen Sie Embeddings für Bedeutungssuche, aber halten Sie Originalquelle, Metadaten und Rechte untrennbar mit jedem Treffer verbunden. Entscheidend ist die gemessene Retrieval-Qualität, nicht der Datenbanktyp allein.

Quellen und Vertiefung

Diese Primärquellen vertiefen Definitionen, technische Grundlagen oder verantwortlichen Einsatz.

Inhaltlich geprüft

Sie möchten das auf Ihre Situation übertragen?

Wir klären gemeinsam, was für Ihren Prozess, Ihre Daten und Ihre Systeme sinnvoll ist – verständlich und ohne unnötige Komplexität.

Projekt besprechen