← Blog

28. März 2026

Mehrsprachiges multimodales RAG: warum Ihre KI Ihre deutschen Dokumente übergeht

Mehrsprachiges RAG, Vergleich von Einbettungsmodellen

Die meisten RAG-Systeme, die heute laufen, haben zwei blinde Flecken: sie verstehen nur Englisch und sie sehen nur Text.

Was die üblichen Prüfstände nicht messen

Die Rangliste MTEB misst nur eines: die Suche nach englischem Text in einem Bestand englischer Texte. In Wirklichkeit arbeiten Unternehmen mit Dokumenten auf Deutsch, mit Bildern und mit Tabellen.

Milvus hat den Prüfstand CCKM geschaffen, der die mehrsprachige Suche, die multimodale Suche und die Suche in langen Dokumenten (32 000 Zeichen) misst.

Ergebnisse beim mehrsprachigen RAG

  • Gemini Embedding 2: 99,7 %
  • Qwen3-VL-2B (quelloffen): 98,8 %
  • OpenAI text-embedding-3-large: 96,7 %
  • Leichte Modelle (nomic-embed-text, mxbai-embed-large): 12-15 %
  • Bei Redewendungen: 3 %

Nur Gemini erreichte eine fehlerfreie Bewertung beim Abgleich chinesischer und englischer Redewendungen.

Ergebnisse bei der multimodalen Suche

  • Qwen3-VL-2B: 94,5 %
  • Gemini: 92,8 %

Die « modality gap » gibt den Ausschlag: Qwen (0,25) gegenüber Gemini (0,73).

Was das für deutschsprachige Mittelständler bedeutet

Die Wahl des Einbettungsmodells entscheidet darüber, ob Ihre KI Ihre Dokumente versteht oder sie übergeht. AS3P setzt für BrainDup auf Milvus, eine quelloffene Vektordatenbank, die Mehrsprachigkeit und Multimodalität von Haus aus beherrscht.

Es gibt mehr als Englisch in der Welt der KI. Und es gibt mehr als Text.

Quelle: Milvus, Prüfstand CCKM.