> Quelle: https://souverana.ch/insights/souveraene-ki-infrastruktur/
> Sprache: de-CH

# Souveräne KI-Infrastruktur: warum das Modell der einfachste Teil ist

Das Sprachmodell ist der austauschbarste Teil Ihrer KI. Warum Embeddings und OCR über den Lock-in entscheiden, und welche Schweizer Hoster alle Komponenten bieten.

Infrastruktur · Veröffentlicht 14.07.2026 · Aktualisiert 14.07.2026 · Joel Barmettler

## Was Infrastruktur bei KI wirklich ist

**Wenn KI Antworten aus Ihren eigenen Dokumenten geben soll, entscheidet alles, was vor dem Sprachmodell liegt. Zur KI-Infrastruktur gehören die Dienste, die Ihre Daten aufbereiten: OCR für Dokumente, Transkription für Audio, Embeddings für die Suche. Das Sprachmodell tauschen Sie an einem Nachmittag. Wechseln Sie dagegen das Embedding-Modell, müssen Sie jedes Dokument neu einlesen.**

**Das Wichtigste in Kürze**

-   Prüfen Sie beim Anbietervergleich, wie viel der Datenaufbereitung er übernimmt. Je mehr, desto teurer wird Ihr Ausstieg.
-   Wählen Sie das Embedding?\-Modell sorgfältiger als das Sprachmodell. Ein Wechsel bedeutet, jedes Dokument neu einzulesen und neu zu indexieren.
-   Was bequem klingt, bindet am stärksten: Dokumente einlesen, einbetten und ablegen zu lassen, ist die engste Abhängigkeit im ganzen Aufbau.
-   Halten Sie die datennahen Modelle offen, OCR? und Embeddings. Nur dann können Sie den Anbieter später überhaupt wechseln.

Die öffentliche Debatte dreht sich fast nur um Sprachmodelle. Für ein Unternehmen ist das Sprachmodell aber nur der letzte Schritt einer längeren Kette.

Dies ist der dritte Teil unserer Serie über souveräne KI und der erste der drei Ebenen-Beiträge: Er behandelt die unterste Schicht, auf der Ihre Daten aufbereitet werden.

Serie · Souveräne KI

1.  1 [Was ist souveräne KI? Ehrlich erklärt, für Schweizer Unternehmen](/insights/was-ist-souveraene-ki/)
2.  2 [KI-Strategie für KMU: die Fragen, die Sie zuerst beantworten müssen](/insights/ki-strategie-kmu/)
3.  3 Souveräne KI-Infrastruktur: warum das Modell der einfachste Teil ist Sie lesen diesen Teil
4.  4 [Souveräne KI-Plattform: warum sie stärker bindet als das Modell](/insights/souveraene-ki-plattform/)
5.  5 [Souveräne KI-Integration: wenn die KI zu handeln beginnt](/insights/souveraene-ki-integration/)

## Das Modell kennt Ihre Dokumente nicht

Ein Sprachmodell ist auf dem öffentlichen Internet trainiert. Von Ihrem Unternehmen weiss es nichts: Ihre Verträge hat es nie gesehen, Ihre Offerten und Sitzungsprotokolle ebenso wenig. Wer KI im Betrieb einsetzt, will aber genau das: Antworten aus den eigenen Dokumenten.

Diese Dokumente liegen als PDF vor, als Office-Dateien, als eingescannte Verträge, als Aufnahmen von Sitzungen. Damit ein Sprachmodell sie nutzen kann, müssen sie zuerst in durchsuchbaren Text verwandelt werden. Dafür sorgt die übrige Infrastruktur: Ein OCR-Modell macht Dokumente und Scans lesbar, Transkription verschriftlicht Audio, ein Embedding-Modell macht den Text durchsuchbar, eine Vektordatenbank legt ihn ab, und erst am Ende formuliert das Sprachmodell aus den passenden Abschnitten eine Antwort.

Dieses Zusammenspiel heisst RAG, Retrieval-Augmented Generation, und läuft in zwei Phasen. Einmalig lesen Sie Ihre Dokumente ein und legen sie durchsuchbar ab. Danach durchläuft jede Frage die zweite Phase, von der Suche über die passenden Abschnitte bis zur belegten Antwort.

Eine RAG-Pipeline als Graph. Oben wird Ihr Wissen einmalig aufbereitet und in der Vektordatenbank abgelegt, unten durchläuft jede Frage die Suche bis zur belegten Antwort. Die Datenbank verbindet beide Zweige, und das Embedding-Modell ist in beiden dasselbe. Vier der Stationen sind eigene KI-Modelle, nicht nur das Sprachmodell am Ende.

Jede dieser Stationen ist eine eigene Entscheidung, mit eigenen Anbietern und eigenen Folgen für die Souveränität. Wer nur auf das Sprachmodell schaut, übersieht den grössten Teil davon. Beginnen wir deshalb bei der Frage, wie ein Unternehmen KI überhaupt bezieht.

## Wie Unternehmen KI beziehen

Wie souverän eine Lösung wird, hängt weniger am gewählten Modell als daran, wie viel Arbeit der Anbieter übernimmt. Was der Anbieter für Sie erledigt, darüber behält er anschliessend auch die Kontrolle. Vier Bezugswege, von der grössten Bequemlichkeit zur grössten Kontrolle:

| Weg | Anbieter | Was Sie bekommen | Datenaufbereitung |
| --- | --- | --- | --- |
| Suite mit KI über Ihre Daten | Microsoft, Google, Infomaniak | fertige Apps plus KI darauf | der Anbieter, in seinem Speicher |
| KI-Plattform mit Ingestion | OpenAI, Mistral | Komponenten plus verwaltete Ablage | der Anbieter, in seiner Cloud |
| Cloud mit Modell-APIs | OVHcloud | Modelle als Dienst, Pipeline bauen Sie | Sie selbst |
| Offene Modelle, selbst betrieben | Scaleway, PHOENIQS, On-Prem | offene Modelle, volle Kontrolle | Sie selbst |

Am bequemsten sind die **Suiten**. Microsoft und Google beherrschen die Unternehmens-KI nicht wegen der besseren Modelle, sondern weil Ihre Dokumente und Mails längst bei ihnen liegen. [Copilot durchsucht SharePoint und OneDrive↗](/insights/microsoft-copilot-datenschutz/), Gemini den Google Drive; die KI liest die Daten, die Sie ohnehin dort halten. Infomaniak gehört in dieselbe Kategorie, mit Schweizer Infrastruktur: Euria durchsucht die Dateien in Ihrem kDrive, gehostet in der Schweiz und auf offenen Modellen. Es ist ein Hosting-Anbieter mit integrierter KI, kein auf KI spezialisiertes Unternehmen.

Die nächste Kategorie sind die **KI-Plattformen**, deren eigentliches Produkt die KI ist. OpenAI und, als europäische Antwort, Mistral geben Ihnen die Komponenten über eine Schnittstelle und bieten an, Ihre Dokumente hochzuladen, einzulesen und durchsuchbar zu machen. Mistral deckt dabei die ganze Breite ab: eigener Assistent (Le Chat), Plattform (AI Studio), OCR, Transkription, Embeddings und On-Premise-Betrieb. Ein souveräner Anbieter kann demnach mit den US-Konzernen mithalten, vom Assistenten bis zur Schnittstelle.

Es folgen die **Cloud-Anbieter** wie OVHcloud, deren Kerngeschäft die Infrastruktur ist und die KI-Modelle als zusätzlichen Dienst anbieten. Am weitesten geht das reine Betreiben offener Modelle bei Scaleway, bei einem Schweizer Anbieter wie PHOENIQS oder auf eigener Hardware. Je eigenständiger der Betrieb, desto mehr richten Sie selbst ein, und desto weniger lässt sich Ihnen später entziehen.

## Wo der Lock-in wirklich sitzt

Das Sprachmodell ist die am leichtesten austauschbare Komponente. Der Prompt bleibt derselbe, und dasselbe offene Modell läuft bei einem Dutzend Anbietern.

Die Bindung entsteht bei den Modellen, die Ihre Daten verarbeiten. Für Suche und RAG wandeln Sie Ihre gesamte Wissensbasis mit einem bestimmten Embedding-Modell in Vektoren um. Dokumente und Suchanfragen müssen dasselbe Modell verwenden, sonst passen die Vektoren nicht zusammen. Das Embedding-Modell bestimmt damit die Struktur Ihres gesamten Datenbestands. Wechseln Sie es, müssen Sie **jedes Dokument neu einlesen und neu indexieren**, denn die Vektoren des einen Modells sind für das andere bedeutungslos.

Hervorgehoben: das Embedding-Modell. Es kommt zweimal vor, bei der Indexierung und bei jeder Frage, und muss beide Male dasselbe sein. Ein Wechsel entwertet die gesamte Vektordatenbank.

Genau deshalb bieten OpenAI, Google und Mistral so bereitwillig an, Ihre Dokumente für Sie einzulesen und abzulegen. Bei OpenAI liegt die Wissensbasis anschliessend in deren Vektorablage, verrechnet pro Gigabyte und Tag. Bei Google übernimmt die RAG-Engine das Einlesen, Zerlegen und Einbetten. Das ist bequem, und genau hier entsteht die stärkste Bindung: Der eingelesene, eingebettete und gespeicherte Datenbestand liegt im Vektorraum und in der Ablage eines Anbieters, und ein Wechsel bedeutet den vollständigen Neuaufbau.

Die zweite anspruchsvolle Komponente ist die Aufbereitung selbst. Saubere, strukturierte Daten aus echten Dokumenten zu gewinnen, aus Schweizer PDF, Scans, Tabellen und drei Landessprachen, ist die eigentliche Ingenieursarbeit. Die Pipeline, die darauf aufsetzt, wird auf das Ausgabeformat eines bestimmten OCR-Dienstes zugeschnitten und ist danach ebenso schwer zu ersetzen.

Hervorgehoben: OCR und Transkription am Anfang der Kette. Ihr Ausgabeformat prägt alles, was danach folgt, und legt Sie auf einen Anbieter fest.

Souveränität auf dieser Ebene bedeutet deshalb vor allem, die datennahen Modelle, Embeddings und OCR, offen zu halten und selbst betreiben zu können. Das Sprachmodell lässt sich jederzeit ersetzen. Ein Wechsel des Embedding-Modells zwingt Sie hingegen, den gesamten indexierten Datenbestand neu aufzubauen.

## Das Modell auswählen

Damit bleibt die Frage, die die meisten zuerst stellen: die nach dem Modell. Sie ist wichtig, aber die am leichtesten korrigierbare Entscheidung von allen. Zwei Anhaltspunkte genügen für den Start. Für die Leistung ordnet der unabhängige Intelligence Index von Artificial Analysis die Modelle nach messbarer Fähigkeit, quer über offene und geschlossene. Für die Kosten gilt, was wir im Beitrag zu [LLM-Kosten](/insights/llm-kosten/) durchgerechnet haben: Das billigste Modell der Preisliste ist selten das günstigste im Betrieb.

Entscheidend für die Souveränität ist nur, dass das Modell offene Gewichte? hat. Dann betreiben Sie es bei mehreren Hostern, vergleichen deren Preise und wechseln, wann Sie wollen.

## Den Hoster wählen

Wer souverän werden will, wählt einen Hoster für offene Modelle statt einer geschlossenen Plattform. Der Vergleich sollte über das Sprachmodell hinausgehen und fragen, wer alle datennahen Modelle auf europäischem oder Schweizer Boden anbietet. Führt ein Hoster nur Sprachmodelle und müssen Sie für Embeddings oder OCR auf eine US-API ausweichen, geht die Souveränität an der wichtigsten Stelle wieder verloren.

Kennzahl

sechs Modellklassen

Ein einziger Schweizer Anbieter, PHOENIQS/kvant, betreibt heute Sprachmodelle, OCR, Embeddings, Reranker, Transkription und Vision, alle als offene Modelle auf Schweizer Servern (u.a. Apertus 70B, MinerU, BGE-M3, Whisper).

Quelle: PHOENIQS Model-as-a-Service, Katalog Stand Juli 2026

Vier Modellarten stecken in der Pipeline (rot): OCR und Transkription, Embedding, Reranking, Sprachmodell. Ein souveräner Hoster muss alle vier anbieten, nicht nur das Sprachmodell am Ende.

Die europäischen Anbieter decken dieses Angebot unterschiedlich weit ab. OVHcloud führt über vierzig offene Modelle samt Transkription, Embeddings und Bildmodellen. Scaleway betreibt Sprachmodelle, Vision und Embeddings auf souveräner Infrastruktur in Paris. Infomaniak bietet dieselben Modelle über eine OpenAI-kompatible API aus der Schweiz. Und PHOENIQS zeigt, dass ein Schweizer Anbieter den kompletten datennahen Satz offen betreiben kann, OCR und Embeddings eingeschlossen.

Die grösste Kontrolle bietet das Selbst-Betreiben offener Modelle auf eigener oder gemieteter GPU. Das ist ein Thema für sich, [dem wir einen eigenen Beitrag widmen↗](/insights/llm-selbst-hosten/): Die Einrichtung ist anspruchsvoll, der laufende Betrieb danach aber erstaunlich genügsam.

## Nicht in Isolation entscheiden

Noch ein Punkt zur Reihenfolge: Diese Modelle wählt man nicht einzeln, denn die Plattform, mit der Ihr Team arbeitet, verlangt eine bestimmte Schnittstelle und oft ein passendes Embedding-Modell. Sie gibt damit einen Teil der Infrastruktur vor. Deshalb bleiben wir hier bei Modell und datennahen Diensten und nehmen die Plattform im nächsten Beitrag dieser Serie vor.

## Was das für Ihr Unternehmen heisst

Souveräne Infrastruktur liefert genauso gute KI. Sie setzen die einzelnen Komponenten selbst zusammen, statt eine fertige, geschlossene Lösung zu mieten. Das Modell ist dabei der einfache Teil. Die Sorgfalt gehört den Modellen, die Ihre Daten verarbeiten, und der Frage, ob Sie diese im Ernstfall zurückholen können.

Sie wollen Modell, Hoster und die datennahen Modelle unabhängig für Ihren Fall auswählen lassen?

[KI-Architektur & Lösungsauswahl](/leistungen/ki-architektur/)

Über der Infrastruktur liegt die Ebene, auf der Ihr Team täglich arbeitet. Ihr widmet sich der nächste Teil der Serie, bevor der letzte zur Integrationsebene kommt.

Der Autor

![Porträt von Joel Barmettler](/_astro/joel-barmettler.CGKHGWrV_sJ0IG.webp)

Joel Barmettler

KI-Architekt · Souverana, Zürich

Joel Barmettler begleitet Schweizer Unternehmen von der KI-Strategie bis zur Integration: souverän, vertraulich und produktionsreif. Er hat den Swiss AI Hub als Architekt aufgebaut und trägt heute Mitverantwortung für dessen Architektur; jedes Souverana-Mandat führt er persönlich. Mandate vom Einzelunternehmen bis zum Fortune-500-Konzern.

[Erstgespräch buchen](https://meet.brevo.com/joel-barmettler/30-minute-meeting) [Mehr über Souverana](/) [LinkedIn](https://www.linkedin.com/in/joel-barmettler-b9ab361b7)

Für die Geschäftsleitung

## Dieses Dossier als PDF

Den vollständigen Beitrag plus eine kompakte Management-Zusammenfassung und Checkliste, als PDF zum Speichern und Weiterleiten.

Sie erhalten das PDF sofort. Mit dem Absenden stimmen Sie zu, dass Souverana Sie zu diesem Thema kontaktieren darf. Verarbeitung in der Schweiz/EU, keine Weitergabe an Dritte, Widerruf jederzeit (revDSG).

## Häufige Fragen

Was gehört zur KI-Infrastruktur?

Mehr als ein Sprachmodell. Zur KI-Infrastruktur gehören auch die Modelle und Dienste, die Ihre Daten aufbereiten: OCR für Dokumente, Transkription für Audio, Embeddings für die Suche sowie eine Schicht für Kostenkontrolle und Zugriff. Das Sprachmodell ist dabei die am leichtesten austauschbare Komponente.

Welches KI-Modell soll ein Unternehmen wählen?

Das Modell, das die Aufgabe zum besten Preis löst, nicht das mit der grössten Schlagzeile. Der unabhängige Intelligence Index von Artificial Analysis ordnet die Modelle nach Leistung; welches im Betrieb günstig ist, hängt am Tokenverbrauch, den wir im Beitrag zu LLM-Kosten durchrechnen. Ein offenes Modell lässt sich zudem bei mehreren Hostern betreiben und jederzeit wechseln.

Wo kann ich LLMs in der Schweiz oder Europa hosten?

Als API bei europäischen Anbietern wie OVHcloud, Scaleway oder Infomaniak, oder auf einer Schweizer Model-as-a-Service-Plattform wie PHOENIQS/kvant, die offene Modelle samt OCR und Embeddings betreibt. Wer maximale Kontrolle will, betreibt die Modelle selbst; das ist ein Thema für sich.

Was ist der Unterschied zwischen einer KI-Plattform und einer Integration?

Eine Integration ist KI, die in ein Produkt eingebaut ist, das Sie ohnehin nutzen (Microsoft Copilot, Google Gemini, Infomaniak Euria). Sie wählen die Infrastruktur nicht. Eine Plattform gibt Ihnen die Komponenten über eine Schnittstelle, damit Sie Ihre eigene Lösung bauen und den Anbieter wechseln können.

Warum sind Embeddings ein Lock-in-Risiko?

Weil Ihre ganze Wissensbasis als Vektoren im Raum eines bestimmten Embedding-Modells gespeichert wird. Dokumente und Suchanfragen müssen dasselbe Modell verwenden. Ein Wechsel des Modells bedeutet, jedes Dokument neu einzulesen und neu zu indexieren. Ein offenes, selbst betriebenes Embedding-Modell hält diese Möglichkeit offen.

LinkedIn

## Diesen Beitrag teilen

Fertig formatierte Grafiken und ein Textvorschlag für Ihren LinkedIn-Post: herunterladen, kopieren, posten.

![Matrix europäischer und amerikanischer KI-Anbieter nach Modellart: Sprachmodell, OCR, Transkription, Embeddings und verwaltete Ingestion. PHOENIQS/kvant und Mistral decken den ganzen Satz, Infomaniak und Scaleway haben Lücken.](/media/souveraene-ki-infrastruktur/infografik.png)

[Infografik herunterladen (PNG)](/media/souveraene-ki-infrastruktur/infografik.png)

Textvorschlag

Beim KI-Einkauf vergleichen die meisten das Sprachmodell. Wissen Sie, welches Modell Ihre Dokumente einliest und in Vektoren übersetzt?

Genau dort entsteht die Abhängigkeit, und genau dort ist das europäische Angebot dünn: Wer Embeddings oder OCR braucht, weicht schnell auf eine US-API aus und verliert die Souveränität an der Stelle, an der die eigenen Daten verarbeitet werden.

Der Blick in die Kataloge (Stand Juli 2026) zeigt das Muster: Ein Sprachmodell hat jeder Anbieter. Beim Rest wird es lückenhaft. Infomaniak bietet kein OCR, Scaleway keine Transkription, OVHcloud OCR nur teils. Einen kompletten Satz aus sechs Modellklassen liefert in der Schweiz heute PHOENIQS/kvant, mit Apertus 70B, MinerU, BGE-M3 und Whisper.

Unser Schluss: Die Sorgfalt gehört nicht dem Sprachmodell. Das tauschen Sie an einem Nachmittag. Beim Embedding-Modell müssen Sie jedes Dokument neu einlesen und neu indexieren, weil die Vektoren des einen Modells für das andere bedeutungslos sind.

Im Beitrag stehen die Anbietermatrix mit sieben Zeilen, die RAG-Kette Schritt für Schritt und sieben Fragen an Ihren KI-Hoster. Link in den Kommentaren.

#KI #Datensouveränität #RAG #Schweiz
