Wer eine KI-Beratung beauftragt, braucht Klarheit über Leistung, Kosten und Verantwortung. Gehört nur die Analyse zum Mandat, oder entwickelt der Anbieter auch die Anwendung, bindet sie an bestehende Systeme an und übernimmt den Betrieb? Gerade diese Unterschiede machen Angebote schwer vergleichbar.
Ein sinnvoller Auftrag beginnt mit einem Anwendungsfall, der den Aufwand rechtfertigt. Daten müssen rechtmässig und zuverlässig verfügbar sein, Identitäts- und Fachsysteme zusammenspielen und Qualitätskriterien feststehen. Nach der Einführung können neue Prompts, Modelle oder Suchindizes das Verhalten verändern. Google Cloud beschreibt generative KI deshalb als laufenden Software-Lebenszyklus aus Analyse, Experimenten, Evaluation, Bereitstellung und Überwachung.
Dieser Leitfaden hilft Unternehmen in der Schweiz, den passenden Umfang festzulegen und Anbieter zu vergleichen. Eine gute Beratung sollte offene Fragen klären, prüfbare Ergebnisse liefern und das eigene Team auf seine späteren Aufgaben vorbereiten.
Den Nutzen an den eigenen Aufgaben prüfen
Bei den richtigen Aufgaben schafft KI einen messbaren Nutzen. Daraus folgt allerdings nicht, dass sie auch bei der nächsten Aufgabe zuverlässig funktioniert. Ein Blick auf die Forschung zeigt beide Seiten.
Das National Bureau of Economic Research untersuchte Mitarbeitende im Kundendienst. Wer Zugang zu einem generativen KI-Assistenten hatte, arbeitete im Schnitt knapp 14 % produktiver. Die Harvard Business School begleitete 758 Beratende in einem Feldexperiment. Innerhalb der Leistungsgrenze des Modells erledigten sie 12,2 % mehr Aufgaben und brauchten 25,1 % weniger Zeit. Bei einer Aufgabe, die bewusst jenseits dieser Grenze lag, lag ihre Wahrscheinlichkeit einer richtigen Lösung um 19 Prozentpunkte niedriger.
Die Ergebnisse zeigen, dass dasselbe Modell je nach Aufgabe helfen oder Fehler begünstigen kann. Ein Beratungsauftrag sollte diese Grenzen mit repräsentativen Fällen aus dem Unternehmen prüfen. Allgemeine Modellvergleiche ersetzen diese Evaluation nicht.
Für die Auswahl eines Partners ist deshalb entscheidend, welche Unsicherheit das Mandat klären soll:
Am Ende des Mandats sollten Nutzen, Datenlage, Architektur, Integration und Betriebsverantwortung so weit geklärt sein, dass das Unternehmen über den nächsten Schritt entscheiden kann.
Was Sie in jeder Phase erhalten sollten
Lassen Sie für jede Phase festhalten, welches Ergebnis übergeben wird und wem es gehört. Strategie, RAG, Agenten, Modellwahl und Umsetzung greifen im Projekt ineinander. Auch das NIST behandelt KI-Risiken im AI Risk Management Framework als fortlaufende Aufgabe mit den Funktionen Govern, Map, Measure und Manage.
Tabelle seitlich scrollen, um alle Spalten zu sehen.
| Phase | Was die Beratung tut | Was Sie erhalten sollten |
|---|---|---|
| Strategie und Anwendungsfallanalyse | Befragt Fach- und Technikverantwortliche, prüft Mengen, Fehlerkosten und messbare Ziele und trennt KI-Probleme von gewöhnlichen Softwareproblemen | Priorisierte Anwendungsfälle, Nutzenhypothesen, Baseline-Kennzahlen, Machbarkeits- und Risikomatrix sowie eine Liste der verworfenen Fälle mit Begründung |
| Prozessanalyse | Zeichnet Ablauf, Entscheidungen, Ausnahmen und Übergaben auf, bevor etwas automatisiert wird | Ist- und Soll-Prozesse, Integrationsübersicht, Ausnahmepfade, Rolle der menschlichen Aufsicht, Grenzen der Automatisierung |
| Datenreife | Klärt, welche Daten es gibt, wer sie verantwortet, wie aktuell und verlässlich sie sind und was rechtmässig genutzt werden darf | Dateninventar, Zugriffsmatrix, Qualitätsbefunde, Berechtigungsmodell, Plan für die Lücken und ein repräsentativer Evaluationsdatensatz |
| Architektur und Modellintegration | Vergleicht Foundation Models und klassisches ML und entscheidet über APIs, Orchestrierung, Abruf, Fine-Tuning oder deterministische Bausteine | Architekturbilder, Entscheidungsprotokolle, Modellvergleich, Sicherheitsgrenzen, Kostentreiber, Abhängigkeit von Anbietern |
| Prototyp oder MVP | Baut einen möglichst kleinen, aber vollständigen Ablauf, der den Nutzen unter realistischen Bedingungen belegt | Funktionsfähige Anwendung, Quellcode, Deployment-Konfiguration, erste Integrationen, erste Evaluationsergebnisse, dokumentierte Grenzen |
| Vorbereitung des Produktivbetriebs | Ergänzt Anmeldung, Berechtigungen, Verwaltung von Zugangsdaten, Logging, Observability, Fallbacks, Limits, Nachvollziehbarkeit und Eskalation | Produktionscode, CI/CD-Pipeline, IAM-Konfiguration, Bedrohungsmodell, Tests, Governance-Unterlagen, Runbooks |
| Evaluation und Launch | Prüft Antwortqualität, Abruf, Sicherheit, Verhalten unter Angriff und Fachkennzahlen gegen vorher vereinbarte Kriterien | Versionierter Testsatz, Ergebnisse je Anwendungsfall, Schwellenwerte, Befunde aus dem Red Teaming, Launch-Entscheid, Liste offener Risiken |
| Betrieb und Optimierung | Überwacht Verhalten, Latenz, Kosten, Fehler, Rückmeldungen und Regressionen, während Modelle und Daten sich ändern | Dashboards, Alarme, Incident-Prozess, Regressionstests, Versionshistorie, Update-Politik, Wissenstransfer |
Die Ergebnisse in der rechten Spalte sollten im Angebot konkret benannt werden. Google nennt in seinen Betriebsleitlinien unter anderem Testdaten für typische Fälle und Randfälle, Versionskontrolle und CI/CD für Prompts und Abrufsysteme sowie Protokollierung und fortlaufende Evaluation nach der Einführung.
Prompt Engineering ist davon nur ein kleiner Ausschnitt. Ob eine Anwendung im Alltag funktioniert, hängt genauso von Abruf, Anwendungslogik, Modellen, Schnittstellen, Berechtigungen und Bedienung ab.
RAG und Agenten erhöhen die Anforderungen
Retrieval-Augmented Generation, kurz RAG, eignet sich für Systeme, die mit internen oder häufig wechselnden Informationen arbeiten. Vereinfacht gesagt sucht die Anwendung zuerst passende Inhalte in den Unternehmensdaten und gibt sie dem Modell als Kontext mit. Das klingt geradlinig, hat aber einige Tücken. Microsoft weist in der Foundry-Dokumentation selbst darauf hin, dass die Qualität stark von der Aufbereitung der Dokumente und den Einstellungen des Abrufs abhängt. Auch mit Quellenkontext kann eine Antwort falsch sein. Sind die Zugriffsrechte unsauber umgesetzt, macht die Suche zudem vertrauliche Inhalte auffindbar.
Zu einem RAG-Mandat gehört deshalb mehr als eine Vektordatenbank. Nötig sind verlässliche Import- und Aktualisierungsprozesse, eine durchdachte Aufteilung und Beschreibung der Inhalte, ein Abruf mit sauberer Berechtigungsprüfung, nachvollziehbare Quellen und eigene Tests für die Suche. Ein Anbieter sollte erklären können, wie er die Qualität des Abrufs unabhängig von der formulierten Antwort misst. Bleibt das vage, fehlt wahrscheinlich Erfahrung aus dem produktiven Betrieb. Zusätzliche Abrufe, Embeddings und mehr Tokens im Prompt erhöhen sowohl die Antwortzeit als auch die Kosten pro Anfrage.
Bei Agenten liegt die Messlatte noch höher. Sobald ein Modell Schnittstellen aufruft, Datenbanken verändert, Nachrichten verschickt, Tickets eröffnet oder Cloud-Ressourcen anpasst, formuliert es nicht mehr bloss Text, sondern handelt. OWASP hat 2026 deshalb eine eigene Top 10 für agentische Anwendungen veröffentlicht. Sie nennt Risiken, die über klassische LLM-Anwendungen hinausgehen: manipulierte Ziele, missbrauchte Werkzeuge und Identitäten, kompromittierte Lieferketten oder unerwartet ausgeführten Code. Prompt Injection bleibt ebenfalls ein Thema. Die schädliche Anweisung kann dabei in einem Dokument versteckt sein, das der Agent verarbeitet, statt direkt von einem Nutzer zu kommen.
Ein Agentenprojekt braucht klar begrenzte Rechte je Werkzeug, eigene Identitäten, Freigaben vor folgenreichen Aktionen, Transaktionslimits, nachvollziehbare Protokolle und Angriffstests. Ebenso muss feststehen, wie Aktionen gestoppt oder rückgängig gemacht werden können. Weitreichende Zugriffsrechte sind fachlich und technisch zu begründen.
Wann Sie keine Beratung brauchen
Nicht jedes KI-Vorhaben braucht externe Unterstützung. Ein internes Team kommt meist gut allein zurecht, wenn das Risiko überschaubar ist, eine fertige Lösung den Bedarf abdeckt und keine anspruchsvolle Integration nötig wird. Die Daten sollten sauber zugänglich sein, das Engineering-Team sollte den Betrieb beherrschen, die Sicherheit den gewählten Dienst bereits beurteilt haben und der Fachbereich selbst sagen können, woran er Erfolg misst.
Externe Hilfe wird interessant, wenn mehrere Bereiche gemeinsam offene Fragen lösen müssen. Typische Beispiele sind mehrere Quellsysteme, sensible eigene Daten, ungeklärte Architektur, Inhalte mit Kundenkontakt, regulierte Entscheide, komplexe Berechtigungen, Agenten mit Schreibrechten oder der Schritt vom Prototyp zum verlässlichen Betrieb.
Für eine erste Einschätzung helfen sieben Fragen:
- Können Sie ein messbares Ziel benennen, statt nur „KI einsetzen“ zu wollen? Wenn nicht, beginnt die Arbeit beim Prozess, nicht bei der Entwicklung.
- Verstehen Sie den heutigen Ablauf und seine Schwachstellen? Wenn nicht, sollte er vor jeder Automatisierung analysiert werden.
- Haben Sie Zugang zu repräsentativen, rechtmässig nutzbaren und ausreichend verlässlichen Daten? Wenn nicht, ist die Datenbasis das erste Projekt.
- Gibt es im Team Engineers, die das System integrieren und betreiben können? Wenn nicht, brauchen Sie praktische Umsetzung statt einer reinen Beratung.
- Können Sie selbst Testfälle und Abnahmekriterien festlegen? Wenn nicht, sollte der Partner diese Kompetenz gemeinsam mit Ihrem Team aufbauen.
- Kann Ihr Sicherheitsteam die Risiken von RAG, Prompt Injection und Agenten beurteilen? Wenn nicht, braucht es dafür zusätzliche Expertise.
- Wer übernimmt das System nach dem Launch? Ist das ungeklärt, sollte der Vertrag den Betrieb oder einen echten Wissenstransfer einschliessen.
Manchmal ist KI schlicht die falsche Antwort. Lässt sich das gewünschte Ergebnis exakt beschreiben, sind klassische Software, Suche, Workflow-Automatisierung oder ein paar klare Regeln oft günstiger und zuverlässiger. Ein Modell bringt dann vor allem zusätzliche Unsicherheit. Fehlt ein messbares Ziel oder die nötige Datengrundlage, sollte das Vorhaben warten. Dasselbe gilt, wenn Fehler nicht tragbar wären, keine sinnvolle Kontrolle möglich ist oder sich der Ablauf ständig grundlegend verändert.
Automatisieren
Klar begrenzte Arbeit in grosser Zahl, bei der ein Fehler schnell auffällt und günstig zu korrigieren ist.
- Ausgangswerte sind gemessen
- Repräsentative Testfälle lassen sich zusammenstellen
- Fehler zeigen sich früh und sind umkehrbar
Unterstützen
Arbeit mit viel Ermessen, bei der ein Mensch für das Ergebnis verantwortlich bleibt.
- Die KI entwirft, eine benannte Person entscheidet
- Das Prüfen kostet weniger als die Arbeit ohne KI
- Freigabe vor folgenreichen Aktionen
Nicht mit KI lösen
Aufgaben mit exakt vorhersehbarem Ergebnis oder mit Fehlern, die sich nicht mehr korrigieren lassen.
- Deterministische Software liefert die Antwort schon
- Eine sinnvolle Prüfung lässt sich nicht einbauen
- Die Aufgabe lässt sich nicht zuverlässig abgrenzen
Welcher Anbieter zu welchem Engpass passt
Für die Anbieterwahl zählt Erfahrung mit dem konkreten Problem. Ein Schweizer Industrieunternehmen, das SAP und technische Dokumentation anbinden möchte, hat andere Integrations- und Prüfanforderungen als eine Bank, ein Onlinehändler oder ein Infrastrukturteam.
Tabelle seitlich scrollen, um alle Spalten zu sehen.
| Anbietertyp | Passt bei | Worauf Sie achten |
|---|---|---|
| Strategieberatung | Priorisierung des Portfolios, Betriebsmodell, Rückhalt in der Geschäftsleitung | Wer setzt die Strategie danach um, und wurde die technische Machbarkeit geprüft? |
| Softwarehaus | Integration von KI-Funktionen in ERP, CRM, SaaS und interne Plattformen | Bringt das Team auch Erfahrung mit Daten und Evaluation mit? |
| Spezialisierte KI-Beratung | Anspruchsvoller Abruf, ML, Modellvergleich, Fine-Tuning, Agenten, KI-Sicherheit | Kann sie die Anwendung rundherum bauen und danach betreiben? |
| Systemintegrator | Breite Vorhaben über etablierte Plattformen und Altsysteme hinweg | Wer arbeitet konkret am Projekt, und wie viele Abstimmungsebenen gibt es? |
| Freelancer | Enge Fragestellung, Architekturreview, Evaluation, kurzfristige Kapazität | Was passiert, wenn diese Person ausfällt? Wer verantwortet Sicherheit und Betrieb? |
| Grosse internationale Beratung | Länderübergreifende Vorhaben mit regulatorischem Gewicht und Change Management | Wer arbeitet konkret am Projekt, und welche Aufgaben gehen an Dritte oder weniger erfahrene Teammitglieder? |
Bei einem Umsetzungsmandat sollte der Partner Fachprozess, Daten, Architektur, Quellcode, Integration, Evaluation und Betrieb gemeinsam erklären können. Soll seine Verantwortung nach der Analyse enden, müssen Auftrag und Übergabe entsprechend abgegrenzt sein.
Was KI-Beratung kostet und welche Faktoren den Preis bestimmen
Einen belastbaren Durchschnittspreis für KI-Beratung gibt es nicht, weil unter diesem Begriff völlig unterschiedliche Leistungen angeboten werden. Das kann eine zweiwöchige Discovery sein, zusätzliche Engineering-Kapazität, ein komplettes RAG-System, Data Engineering, Sicherheitsarbeit oder ein internationales Transformationsprogramm.
Einen groben Eindruck vermitteln öffentlich zugängliche Beschaffungsunterlagen. Im britischen Rahmenvertrag G-Cloud nennt ein Data-Science-Dienst mit KI und ML Tagessätze von 240 bis 940 GBP. Eine andere Preisliste reicht von 500 GBP für eine Datenschutzanalystin über 850 GBP für einen AI Data Engineer und 1.100 GBP für einen Lead AI Architect bis zu 1.400 GBP für einen Principal AI Architect, jeweils ohne Mehrwertsteuer und Spesen. Ein weiteres Angebot für generative KI nennt 300 bis 1.400 GBP pro Tag. Das sind Listenpreise aus Grossbritannien, keine unabhängigen Durchschnittswerte und erst recht keine verlässlichen Schweizer Marktpreise.
Für die Gesamtkosten müssen Tagessatz, Teamzusammensetzung und Umfang gemeinsam betrachtet werden. Architektur- und Datenfragen früh zu klären kann spätere Umbauten vermeiden. Routineaufgaben benötigen dagegen nicht zwingend dieselbe Erfahrung wie eine komplexe Integrationsentscheidung.
Vier Vertragsformen kommen infrage. Abrechnung nach Aufwand eignet sich für eine offene Analyse und iterative Entwicklung, ein Festpreis für klar abgegrenzte Ergebnisse. Ein Betriebsvertrag regelt Überwachung, Wartung und Support. Bezahlte Meilensteine erlauben eine getrennte Entscheidung nach Analyse, MVP und Prüfung der Betriebsreife. So wird die nächste Investition erst freigegeben, wenn die Ergebnisse dafür sprechen.
Ein Vertrag sollte nie voraussetzen, dass jeder Prototyp automatisch in Produktion geht.
Für standardisierte Aufgaben lohnt sich zunächst der Vergleich mit fertigen Produkten. Eigenentwicklung kommt infrage, wenn besondere Abläufe, Daten, Benutzerführung oder Kontrollen nötig sind. Häufig werden Modell oder Plattform eingekauft und Prozesslogik sowie Integration selbst entwickelt. Das Training eines eigenen Foundation Models benötigt dagegen grosse Datenmengen, spezialisierte Hardware und entsprechende Fachkenntnisse.
Wie lange Analyse, MVP und Implementierung dauern
Auch bei der Dauer gibt es keinen sinnvollen Branchendurchschnitt. Veröffentlichte Zeitpläne einzelner Anbieter geben immerhin eine Grössenordnung, solange man sie als Angebot und nicht als Norm liest. IBM nennt für seinen G-Cloud-Dienst einen Tag für den Strategieauftakt, zwei bis vier Wochen für Discovery-Workshops und danach etwa drei bis vier Wochen bis zum gemeinsam entwickelten MVP. Ein anderer Anbieter rechnet mit ein bis zwei Wochen Vorbereitung, vier bis sechs Wochen iterativer Discovery und weiteren vier bis sechs Wochen vom Prototyp in Richtung Betrieb.
Für eine erste Planung können zwei bis sechs Wochen für Analyse und Reifegradprüfung, drei bis acht Wochen für ein fokussiertes MVP und weitere vier bis zwölf Wochen oder mehr für die Betriebsreife angesetzt werden. Das sind Orientierungswerte, keine Projektzusage. Offene Datenverantwortung, Freigaben und Integration können die Dauer erheblich verlängern. Zur Betriebsreife gehören unter anderem Identitäts- und Zugriffsverwaltung, Sicherheitstests, Ausfallsicherheit und dokumentierte Verantwortung.
Bei regulierten Anwendungen, eigenem Machine Learning, autonomen Agenten oder selbst betriebener Infrastruktur muss mit mehr Zeit gerechnet werden. Nach der Einführung bleiben Modellpflege, Qualitätssicherung und Wartung laufende Aufgaben.
- 012 bis 6 Wochen
Analyse und Reifegradprüfung
- Priorisierte Anwendungsfälle mit Ausgangswerten
- Ablauf, Daten und Berechtigungen aufgezeichnet
- Regulatorische Einordnung geklärt
- Begründete Abgrenzung des Auftrags
- 023 bis 8 Wochen
Ein fokussiertes MVP
- Ein kleiner, vollständig ausführbarer Ablauf
- Testsatz und Abnahmeschwellen
- Dokumentierte Grenzen
- Ergebnisse als Grundlage für den nächsten Auftrag
- 034 bis 12 Wochen und mehr
Betrieb vorbereiten
- Anmeldung, Berechtigungen, Verwaltung von Zugangsdaten
- Observability, Fallbacks und Rollback
- Sicherheitstests und Tests unter Angriff
- CI/CD und Runbooks
- 04Laufend
Betreiben und verbessern
- Qualität, Latenz, Kosten und Fehler im Blick
- Regressionstests, während Modelle sich ändern
- Versionen von Prompts, Modellen und Abruf
- Wissenstransfer an Ihr Team
Cloud, privat oder selbst gehostet
Bei der Betriebsform gibt es keine pauschal richtige Antwort. Sie hängt davon ab, welche Kontrolle nötig ist und welchen Aufwand das eigene Team übernehmen kann.
Tabelle seitlich scrollen, um alle Spalten zu sehen.
| Ansatz | Was Sie gewinnen | Was Sie übernehmen |
|---|---|---|
| Verwaltete Cloud oder API | Schnell starke Modelle, kaum eigene Serving-Infrastruktur, früher Zugang zu Neuem | Abhängigkeit vom Anbieter, Prüfung von Vertrag und Auftragsbearbeitung, schwankende Nutzungskosten, Änderungen an Modell und Schnittstelle ohne Ihr Zutun |
| Verwaltet privat oder gemischt | Engere Grenzen für Netz und Daten, bei weiterhin verwalteten Bausteinen | Mehr Arbeit an Architektur und Plattform, und die Abhängigkeiten verschwinden nicht |
| Selbst gehostet mit offenen Gewichten | Volle Kontrolle über Laufzeit, Infrastruktur und bestimmte Datenwege | GPU-Kapazität, Skalierung, Patches, Modellpflege, Observability, Sicherheit und Pikett liegen bei Ihnen |
Selbsthosting allein erfüllt noch keine Datenschutzanforderungen. Entscheidend ist, wie Personendaten bearbeitet werden und wer Zugriff hat. Ein RAG-System kann vertrauliche Inhalte auch im eigenen Rechenzentrum offenlegen, wenn Berechtigungen fehlerhaft umgesetzt sind.
Die Betriebskosten gehören deshalb auf den Tisch, bevor die Architektur festgelegt wird. Je nach Aufbau zählen dazu Inferenz oder API-Nutzung, Embeddings, Such- und Vektorinfrastruktur, Speicher, Datenimport, GPUs, Hosting, Überwachung, Sicherheitswerkzeuge, Evaluationsläufe, Wartung und Support.
Den KI-Beratungspartner vor der Beauftragung prüfen
Im Auswahlgespräch zählen konkrete Erfahrungen mehr als das richtige Vokabular. Bitten Sie den Anbieter, ein vergleichbares Projekt vom ursprünglichen Problem bis zum laufenden Betrieb zu erklären. Ein ansprechender Prototyp sagt wenig, wenn offenbleibt, wie Identitäten und Berechtigungen umgesetzt wurden, wie die Evaluation aussah, was bei einem Störfall geschieht und wie das System an das Kundenteam übergeben wurde.
Tabelle seitlich scrollen, um alle Spalten zu sehen.
| Bereich | Die Frage | Was eine gute Antwort enthält |
|---|---|---|
| Nutzen | Woran erkennen Sie, dass dieser Fall besser ohne KI läuft? | Baseline-Kennzahlen, geprüfte Alternativen, klare Abbruchkriterien |
| Daten | Was brauchen Sie, bevor die Entwicklung beginnt? | Quellenverzeichnis, Analyse von Zugriff und Qualität, Prüfung der Rechtmässigkeit |
| Modellwahl | Wie vergleichen Sie Modelle? | Prüfung an den eigenen Aufgaben statt Ranglisten |
| Abruf | Wie prüfen Sie den Abruf getrennt von der Antwort? | Kennzahlen für den Abruf, repräsentative Fragen, Quellenangaben, Berechtigungen in der Suche |
| Agenten | Was darf der Agent ohne Freigabe tun? | Geringste Rechte, klar begrenzte Schnittstellen, Freigabepunkte, Protokolle |
| Entwicklung | Wer verantwortet die Anbindung an unsere Systeme? | Erfahrung mit Schnittstellen, Tests, CI/CD, Infrastructure as Code, Eigentum am Code |
| Evaluation | Was muss vor dem Betrieb erfüllt sein? | Versionierter Testsatz, Abnahmeschwellen, menschliche Prüfung, Fälle unter Angriff |
| Sicherheit | Wie gehen Sie mit Prompt Injection und Datenabfluss um? | Bedrohungsmodell, Red Teaming, Kontrolle der Ausgaben, Berechtigungen im Abruf |
| Regulierung | Wer ordnet die Pflichten nach DSG, DSGVO und KI-Verordnung ein? | Dokumentierte Datenwege, Rollen als Verantwortlicher und Auftragsbearbeiter, Verfahren für Folgenabschätzungen |
| Betrieb | Was überwachen Sie nach dem Launch? | Qualität, Latenz, Fehler, Nutzung, Kosten und Sicherheitssignale |
| Ausfall | Was passiert, wenn Modell oder Abruf ausfallen? | Zeitlimits, Fallbacks, geordnete Einschränkung, Rollback |
| Eigentum | Was wird uns nach Abschluss übergeben? | Quellcode, Infrastruktur als Code, Prompts, Testsätze, Dokumentation |
Auch die Warnzeichen ähneln sich von Projekt zu Projekt: Genauigkeitsangaben ohne definierte Messgrösse, kein eigener Testsatz, das Versprechen eines RAG-Systems ohne Halluzinationen oder weitreichende Rechte für Agenten. Skepsis ist ebenso angebracht, wenn ein Anbieter Code und Konfiguration nur zögerlich übergeben will, ausschliesslich Demos zeigen kann, zum Support nach dem Launch nichts Konkretes sagt oder schon ein Produkt empfiehlt, bevor die Anforderungen geklärt sind.
Eine Demo mit wenigen ausgewählten Dokumenten bildet den späteren Betrieb nur teilweise ab. Dort kommen veraltete Inhalte, unterschiedliche Berechtigungen, gleichzeitige Zugriffe, Fehlerfälle und wechselnde Quellenqualität hinzu. Microsoft behandelt Abrufqualität und Zugriffskontrolle deshalb als fortlaufende technische Aufgaben.
Die Schweiz und die EU im Jahr 2026
Für Schweizer Unternehmen ist die rechtliche Ausgangslage klarer, als es die Diskussion über ein künftiges KI-Gesetz vermuten lässt: Das bestehende Datenschutzrecht gilt bereits heute. Das revidierte Datenschutzgesetz ist seit dem 1. September 2023 in Kraft. Laut EDÖB erfasst es auch KI-gestützte Bearbeitungen von Personendaten. Geht es ausschliesslich um Sachangaben ohne Bezug zu bestimmbaren Personen, fällt die Bearbeitung in der Regel nicht darunter.
Ein allgemeines KI-Gesetz gibt es in der Schweiz im August 2026 noch nicht. Der Bundesrat will die Rahmenkonvention des Europarats über KI umsetzen und dabei insbesondere Transparenz, Datenschutz, Nichtdiskriminierung und Aufsicht regeln. Eine Vernehmlassungsvorlage ist bis Ende 2026 angekündigt. Daneben gelten weiterhin die Vorschriften der jeweiligen Branche.
Wer unter die KI-Verordnung der EU fällt, hat einen genaueren Fahrplan. Die Verordnung ist seit dem 2. August 2026 allgemein anwendbar. Die Vorschriften zu verbotenen Praktiken und zur KI-Kompetenz gelten seit Februar 2025, jene zu Governance und zu Modellen mit allgemeinem Verwendungszweck seit August 2025. Nach dem AI Omnibus, der am 27. Juli 2026 in Kraft trat, gilt für Hochrisikofälle nach Anhang III eine Frist bis zum 2. Dezember 2027, für Hochrisiko-KI in regulierten Produkten nach Anhang I bis zum 2. August 2028.
Wo die DSGVO anwendbar ist, kommt eine weitere Ebene hinzu. Artikel 22 begrenzt Entscheide, die allein auf automatisierter Bearbeitung beruhen und rechtliche oder ähnlich erhebliche Folgen haben. Artikel 35 verlangt eine Folgenabschätzung, wenn die Bearbeitung voraussichtlich ein hohes Risiko für die Rechte der betroffenen Personen mit sich bringt. In seiner Stellungnahme 28/2024 befasst sich der Europäische Datenschutzausschuss ausdrücklich mit KI-Modellen. Ob ein mit Personendaten trainiertes Modell als anonym gilt und ob berechtigte Interessen als Rechtsgrundlage ausreichen, muss demnach im Einzelfall beurteilt werden.
Für die Beschaffung bedeutet das: Datenwege und Verwendungszwecke müssen ebenso dokumentiert werden wie Modellanbieter, Auftragsbearbeiter und Unterauftragnehmer, Aufbewahrungsfristen, Übermittlungen ins Ausland, Zugriffsrechte, automatisierte Entscheide und menschliche Eingriffe. Eine gute Beratung liefert diese Dokumentation, statt die Themen nur in einem Workshop anzusprechen. Die rechtliche Beurteilung selbst gehört weiterhin in die Hände von Fachleuten für Recht und Datenschutz.
Was die Studien wirklich zeigen
Bei veröffentlichten Erfolgsgeschichten lohnt sich eine klare Trennung zwischen Unternehmensangaben und unabhängigen Studien.
UBS berichtet etwa von einem System, das im Leistungsmanagement Beurteilungstexte vorbereitet, während die Vorgesetzten für das Urteil verantwortlich bleiben. Nach Angaben der Bank spart das mehr als 32.000 Führungsstunden pro Jahr. Das Beschaffungssystem „Front Door“ soll die Zahl der manuell erfassten Felder um fast 40 % reduziert und Vorhaben um bis zu 60 % beschleunigt haben. Siemens nennt aus ersten Pilotprojekten mit dem Industrial Copilot eine durchschnittlich 25 % kürzere Zeit für reaktive Wartung. Solche Eigenangaben sind keine kontrollierten Studien und taugen nicht als Prognose für das eigene Projekt. Interessant ist aber das gemeinsame Muster: Die KI übernimmt einen klar umrissenen Teil eines Ablaufs, während die Verantwortung bei einem Menschen bleibt.
Die Studien des National Bureau of Economic Research und von Harvard untersuchen jeweils bestimmte Aufgaben unter definierten Bedingungen. Für das eigene Projekt lässt sich daraus ein Vorgehen ableiten: Ausgangszustand messen, repräsentative Fälle testen und Kontrolle entsprechend den Fehlerfolgen gestalten. Eine Ausweitung sollte auf den Ergebnissen des eigenen Pilotprojekts beruhen.
Wo Sie anfangen sollten
Bereiten Sie für das erste Gespräch den heutigen Ablauf, die wichtigsten Kosten oder Verzögerungen und das gewünschte Ergebnis vor. Danach werden Datenlage, Regulierung und technische Alternativen geprüft. Ein erstes MVP sollte einen kleinen Ablauf vollständig abbilden und vereinbarte Tests bestehen. Vor der Einführung werden Betrieb, Überwachung und Übergabe geregelt.
Lassen Sie Umfang, Ergebnisse und Entscheidungspunkte schriftlich festhalten. Das erleichtert den Vergleich der Angebote und die spätere Abnahme.
Bei Alpine Edge klären wir gemeinsam, ob ein Anwendungsfall die Investition wert ist. Geeignete Fälle begleiten wir von der Analyse über Architektur und Integration bis zum produktiven Betrieb. Eine abgegrenzte technische Beurteilung kann den nötigen Umfang und die grössten offenen Fragen vor der Umsetzung bestimmen.
Woher diese Zahlen kommen
- Europäische Kommission, Rechtsrahmen für KI. Anwendungsdaten der KI-Verordnung inklusive der Omnibus-Änderungen 2026.
- Europäische Kommission, Inkrafttreten des AI Omnibus. Bestätigt den 27. Juli 2026.
- Schweizerische Bundeskanzlei, Regulierung von KI. Stand und geplante Vernehmlassung.
- EDÖB, KI und Datenschutz. Zur Anwendbarkeit des DSG.
- EDÖB, KI im Alltag. Zu Personendaten in KI-Bearbeitungen.
- EUR-Lex, DSGVO. Volltext, inklusive Artikel 22 und 35.
- Europäischer Datenschutzausschuss, Stellungnahme 28/2024. KI-Modelle und DSGVO-Grundsätze.
- NIST, AI Risk Management Framework.
- NIST, AI RMF Playbook. Govern, Map, Measure und Manage.
- Microsoft, Retrieval-Augmented Generation und Indizes. Azure AI Foundry: Aufbau, Sicherheit, Grenzen und Kosten.
- Google Cloud, generative KI-Anwendungen bereitstellen und betreiben. Evaluation, CI/CD, Überwachung und Lebenszyklus.
- OWASP, Top 10 für LLM-Anwendungen 2026.
- OWASP, Top 10 für agentische Anwendungen 2026.
- National Bureau of Economic Research, Generative AI at Work. Felddaten zur Produktivität im Kundendienst.
- Harvard Business School, Navigating the Jagged Technological Frontier. Das Feldexperiment mit 758 Beratenden.
- UBS, Innovation und KI. Angaben des Unternehmens.
- Siemens, Mitteilung zum Industrial Copilot. Angabe des Herstellers zum Pilotprojekt.
- UK Digital Marketplace, IBM-Dienst für generative KI. Veröffentlichte Struktur von Discovery und MVP.
- UK Digital Marketplace, Dienst für generative KI. Veröffentlichter Zeitplan und Preise.
- UK Digital Marketplace, Cloud Data Science AI/ML. Veröffentlichte Preisspanne.
- UK Digital Marketplace, Saracen AI Services. Rollenbasierte Tagessätze.