we-make.ai

Lokale KI im Mittelstand: Wann es sich lohnt und wann nicht


Wer im Mittelstand heute KI nutzt, nutzt sie meist über externe Cloud-Dienste: ChatGPT, Microsoft Copilot, Google Gemini. Das funktioniert, und es kostet mehr, als die Rechnung ausweist. Bezahlt wird auch mit Abhängigkeit von wenigen US-Konzernen und mit der Kontrolle über die eigenen Daten.

Seit 2025 gibt es eine ernstzunehmende Alternative. Open-Source-Sprachmodelle haben qualitativ zu den großen proprietären Systemen aufgeschlossen. Sie lassen sich auf eigener Hardware betreiben, im eigenen Serverraum oder in einem zertifizierten Rechenzentrum in Österreich. Die Daten verlassen das Unternehmen dabei nicht.

Ob das für Ihr Unternehmen die richtige Entscheidung ist, hängt an Ihrem Nutzungsvolumen, an der Art der verarbeiteten Daten und an den IT-Ressourcen, die Sie dafür freimachen können. Dieses Whitepaper hilft Ihnen, die Frage zu beantworten. Es sagt auch, wann die Antwort Nein lautet. Was wir daraus in Projekten machen, steht auf der Seite zu lokaler KI-Infrastruktur.

Whitepaper kostenlos herunterladen

Neunzehn Seiten Entscheidungsgrundlage, nach dem Absenden sofort als PDF.

Alle Felder sind Pflichtfelder.

Bitte geben Sie Ihren Vornamen an.
Bitte geben Sie Ihren Nachnamen an.
Bitte geben Sie eine E-Mail-Adresse an.
Bitte geben Sie eine gültige E-Mail-Adresse an.
Bitte geben Sie eine Telefonnummer an.
Bitte geben Sie die Nummer mit Ländervorwahl an, z.B. +43 660 123 456.
Bitte geben Sie Ihr Unternehmen an.
Um fortzufahren, müssen Sie die Datenschutzerklärung akzeptieren.

Drei Fragen, die Ihre Entscheidung vorwegnehmen


Bevor Sie weiterlesen: Diese drei Fragen zeigen, ob das Thema für Ihr Unternehmen überhaupt relevant ist.

1. Verarbeiten Ihre Mitarbeiter regelmäßig vertrauliche Daten mit KI-Werkzeugen?
Gemeint sind echte Unternehmensdaten: Angebote, Verträge, Kundendaten, Mitarbeiterinformationen, Konstruktionszeichnungen, Mandatsakten. Wenn ja, verlassen diese Informationen bei jeder Anfrage Ihr Unternehmen und landen auf Servern, über die Sie keine Kontrolle haben. Das ist dann keine abstrakte Datenschutzfrage mehr. Es ist eine Entscheidung, die Sie bewusst treffen oder unbewusst längst getroffen haben.

2. Ist Ihr Nutzungsvolumen hoch genug, dass die Kosten relevant sind?
Ab etwa fünfzehn bis zwanzig aktiven Nutzern, die täglich mit KI-Werkzeugen arbeiten, entstehen monatliche Betriebskosten, die eine Investitionsrechnung rechtfertigen. Zehn aktive Nutzer liegen nach der Break-even-Tabelle des Whitepapers bei 300 bis 1.000 Euro Cloud-Kosten im Monat, und der Break-even dauert dort zweieinhalb bis knapp fünf Jahre. Darunter ist der wirtschaftliche Hebel zu klein.

3. Sind Sie bereit, einmalig in Infrastruktur zu investieren?
Lokale KI ist kein Abo-Modell. Die Hardware muss beschafft und danach betrieben werden, und das erfordert interne IT-Ressourcen oder einen Dienstleister, der die Rolle übernimmt. Wer beides nicht aufbringen will, fährt mit einer europäischen Cloud-Lösung vorerst besser.

Zwei Ja von drei: Eine detaillierte Prüfung lohnt sich. Ein Ja oder keines: Lokale KI ist aktuell nicht Ihre Priorität.

Was Sie in diesem Whitepaper erwartet


Eine Entscheidungsgrundlage mit konkreten Zahlen, die auch den Fall benennt, in dem lokale KI die falsche Wahl ist.

Entscheidungsrahmen: Macht lokale KI für Ihr Unternehmen Sinn?

Drei Fragen entscheiden die Sache vor, noch bevor es um Hardware geht. Das Whitepaper führt sie aus und nennt die Schwelle, ab der sich eine Investitionsrechnung überhaupt lohnt.

Kosten in der Praxis: Was lokale KI wirklich kostet

Hardware in drei Größenklassen, getrennt nach Modellqualität und nach der Zahl der Nutzer, die sie trägt. Dazu Strom, Wartung und Serverhousing mit der Annahme, unter der sie gelten, eine Break-even-Tabelle für zehn bis fünfzig aktive Nutzer und ein durchgerechnetes Beispiel, dessen Ergebnis gegen das eigene Angebot ausfällt.

Rechtliche Lage: Was DSGVO und CLOUD Act für Ihr Unternehmen bedeuten

Zweckbindung, Drittstaatentransfer und Rechenschaftspflicht, übersetzt in den KI-Alltag. Dazu die fünf Branchen mit dem höchsten Haftungsrisiko und eine klare Grenze: Das Kapitel gibt Orientierung, es ersetzt keine Rechtsberatung.

Welche KI-Modelle taugen für welche Aufgaben?

Qwen, Mistral, DeepSeek, Llama, Gemma, Granite und Phi unterscheiden sich deutlich in ihren Deutschkenntnissen und in ihrem Hardware-Hunger. Eine Tabelle ordnet sie sechs Anwendungsprofilen zu, vom internen Assistenten bis zur compliancekritischen Umgebung. Mit dem Hinweis, dass diese Rangfolge sich bewegt: Meta hat seit dem Frühjahr 2025 kein neues Llama mehr veröffentlicht.

Umsetzungsfahrplan: Von der Entscheidung zum laufenden System

Vier Phasen, jede mit ihrem eigenen Zeitrahmen: Readiness-Check und Strategie, Hardware-Beschaffung und Setup, Integration in die Arbeitsabläufe, danach der laufende Betrieb. Mit den Fragen, die vor dem Start beantwortet sein sollten.

Serverhousing: lokale KI ohne eigenen Serverraum

Wer keinen geeigneten Serverraum hat, stellt die eigene Hardware in ein österreichisches Rechenzentrum. Das Kapitel beschreibt, was dort an Stromversorgung, Klimatisierung, Zutrittskontrolle und Zertifizierung dazukommt, und warum das etwas anderes ist als ein Cloud-Dienst.

Wann lokale KI nicht die richtige Wahl ist


Dieses Kapitel ist uns wichtig, auch wenn es unserem eigenen Interesse widerspricht. Es gibt vier Fälle, in denen wir abraten:

Zu geringes Nutzungsvolumen. Ein paar Anfragen am Tag, kein regelmäßiger Einsatz mit sensiblen Daten: Dann rechtfertigt die Sache weder die Hardware-Investition noch den Betriebsaufwand. Ein europäischer Cloud-Anbieter ist hier die pragmatischere Wahl.

Keine IT-Ressourcen für den Betrieb. Updates, Monitoring, gelegentliche Konfigurationsanpassungen: Wenn Ihre IT bereits am Limit läuft und kein Dienstleister diese Rolle übernehmen kann, fehlt die Grundlage.

Hohe Anforderungen an Aktualität. Marktrecherche in Echtzeit oder die Auswertung tagesaktueller Nachrichten decken lokale Modelle ohne zusätzliche Anbindung nicht ab. Cloud-Modelle mit Web-Zugang sind hier im Vorteil.

Sehr spezialisierte oder multimodale Aufgaben. Komplexe Bildanalyse in medizinischer Qualität oder sehr komplexe Mehrschritt-Agentensysteme brauchen ein Modell, das für genau diese Aufgabe ausgewählt und erprobt ist. Mit dem Assistenzbetrieb, den dieses Whitepaper durchrechnet, hat das wenig zu tun; solche Vorhaben sehen wir uns einzeln an.

Das Whitepaper beschreibt deshalb auch die Hybrid-Strategie: sensible Routineaufgaben lokal, aktualitätsgetriebene Aufgaben über einen europäischen Anbieter.

Was tatsächlich passiert, wenn KI-Anfragen das Unternehmen verlassen


Viele Entscheider unterschätzen, was bei der Nutzung externer KI-Dienste konkret passiert. Ein paar Fakten, die das greifbar machen:

Der US CLOUD Act (Clarifying Lawful Overseas Use of Data Act, 2018) verpflichtet US-amerikanische Unternehmen, Daten auf Anfrage amerikanischer Strafverfolgungsbehörden herauszugeben, unabhängig davon, ob diese Daten auf Servern in den USA oder in europäischen Rechenzentren liegen. Microsoft, Google, Amazon, Apple und OpenAI sind US-Unternehmen und unterliegen ihm. Ob ein Anbieter Sie über eine solche Anordnung informieren darf, hängt von der Anordnung ab.

Die DSGVO lässt die Übermittlung personenbezogener Daten in Drittstaaten nur unter bestimmten Bedingungen zu. Seit dem Schrems-II-Urteil ist die Lage für die USA unsicher; das EU-US Data Privacy Framework von 2023 hat sie entspannt, aber nicht aufgelöst. Österreichische und deutsche Datenschutzbehörden haben mehrfach darauf hingewiesen, dass der Widerspruch zum CLOUD Act ungelöst ist. Das Risiko trägt dabei das datenverarbeitende Unternehmen, also Ihres.

Besonders hoch ist es für Rechtsanwälte und Steuerberater (Verschwiegenheitspflichten über Mandatsdaten), den Gesundheitsbereich (besonders schutzwürdige Patientendaten), Finanzdienstleister (eigene Anforderungen von FMA und BaFin an das Drittanbieter-Management), produzierende Unternehmen (Konstruktionsdaten und Fertigungsgeheimnisse) und HR-Dienstleister (Bewerber- und Mitarbeiterdaten).

Lokale KI löst das strukturell. Nicht über einen Vertrag, der zusichert, dass Daten sicher sind, sondern dadurch, dass es keinen Drittstaatentransfer gibt, den ein Vertrag regeln müsste. Interne Pflichten wie Zugriffsrechte und Dokumentation bleiben davon unberührt. Das Kapitel im Whitepaper gibt eine allgemeine Orientierung und ersetzt keine Rechtsberatung.

Ein realistisches Kostenbild


Die häufigste Frage in Erstgesprächen: „Was kostet das ungefähr?“ Eine pauschale Antwort gibt es nicht, einen Orientierungsrahmen schon. Er beginnt an einer Stelle, die in solchen Rechnungen meist übersprungen wird: bei der Frage, was ein Nutzer ist.

Ein aktiver Nutzer arbeitet täglich mit dem System. Eine gleichzeitige Anfrage belegt die Hardware in genau diesem Moment. Das Whitepaper rechnet mit einer gleichzeitigen Anfrage je zehn aktiven Nutzern und nie mit weniger als zwei. Zwanzig aktive Nutzer erzeugen damit zwei gleichzeitige Anfragen, fünfzig erzeugen fünf. Ohne diese Zahl lässt sich keine Hardware-Empfehlung überprüfen.

Ein Server der Einstiegsklasse mit einer modernen Consumer-GPU trägt drei gleichzeitige Anfragen, also bis etwa dreißig aktive Nutzer. Hardware und Einrichtung zusammen: 7.000 bis 14.000 Euro. Die Mittelklasse mit einer oder zwei Enterprise-GPUs trägt bis zu hundert aktive Nutzer und liegt bei 17.000 bis 39.000 Euro. Die Unternehmensklasse beginnt bei 45.000 Euro und braucht ein eigenes Sizing-Gespräch. Was eine Klasse nach oben treibt, ist dabei die Modellgröße und nicht der Andrang.

Laufend fallen an: 40 Euro Strom im Monat in der Einstiegsklasse und 80 Euro in der Mittelklasse, gerechnet mit Bürobetrieb und 0,20 Euro je Kilowattstunde, dazu zwei bis vier Stunden IT-Zeit für die Wartung. Steht die Hardware im Rechenzentrum, kostet das Serverhousing 150 bis 500 Euro und der Strom steckt darin.

Demgegenüber die Cloud: 30 bis 100 Euro je aktivem Nutzer im Monat, je nachdem, ob es bei der Seat-Lizenz bleibt oder Automatisierungen dazukommen. Zwanzig aktive Nutzer liegen damit bei 600 bis 2.000 Euro. Für dieses Team amortisiert sich eigene Hardware innerhalb von neun bis neunzehn Monaten, Einrichtung und laufende Kosten eingerechnet.

Bei zehn aktiven Nutzern trägt die Rechnung nicht mehr. Das Whitepaper führt diesen Fall als eigene Tabellenzeile, und bis zum Break-even vergehen zweieinhalb bis knapp fünf Jahre.

Rechnet sich das für Ihr Unternehmen?

Die Antwort samt Break-even-Tabelle steht im kostenlosen Whitepaper.

Alle Felder sind Pflichtfelder.

Bitte geben Sie Ihren Vornamen an.
Bitte geben Sie Ihren Nachnamen an.
Bitte geben Sie eine E-Mail-Adresse an.
Bitte geben Sie eine gültige E-Mail-Adresse an.
Bitte geben Sie eine Telefonnummer an.
Bitte geben Sie die Nummer mit Ländervorwahl an, z.B. +43 660 123 456.
Bitte geben Sie Ihr Unternehmen an.
Um fortzufahren, müssen Sie die Datenschutzerklärung akzeptieren.

Über den Autor


Dieses Whitepaper stammt von Dr. Bernhard J. Mayr, MBA, Geschäftsführer der passgenau-digital GmbH, die unter der Marke we-make.ai mittelständische Unternehmen im DACH-Raum bei KI-Projekten begleitet, von der Prozessanalyse bis zum Aufbau lokaler KI-Infrastruktur. Wer hinter we-make.ai steht, steht auf der Seite über uns.

Wenn Sie nach der Lektüre prüfen möchten, ob lokale KI für Ihr Unternehmen sinnvoll ist: Ein erstes Gespräch dauert 30 Minuten und kostet nichts. Im Zweifel endet es mit einem Abraten.

Kontakt aufnehmen  |  Termin direkt buchen

Häufige Fragen zu lokaler KI

Brauchen wir einen KI-Ingenieur, um ein lokales Sprachmodell zu betreiben?

Für die Einrichtung nicht. Moderne Deployment-Werkzeuge nehmen ein Modell in wenigen Schritten in Betrieb; was früher Tage an Konfiguration kostete, ist heute in Stunden erledigt. Eine technisch versierte IT-Kraft oder ein externer Dienstleister genügt. Im laufenden Betrieb rechnet das Whitepaper mit zwei bis vier Stunden interner IT-Zeit im Monat für Systempflege und Modell-Aktualisierungen. Das ist kein Vollzeitjob, es braucht aber jemanden, der sich zuständig fühlt.

Wie lange dauert es, bis ein lokales System produktiv läuft?

Der Fahrplan im Whitepaper rechnet mit zwei bis vier Wochen für Readiness-Check und Umsetzungskonzept, zwei bis sechs Wochen für Beschaffung und Setup (die Lieferzeit für Standard-Konfigurationen liegt bei zwei bis vier Wochen) und vier bis acht Wochen für die Integration in die Arbeitsabläufe. Das technische Setup selbst dauert zwei bis fünf Tage reine Arbeitszeit. Den größten Teil der Zeit kostet nicht die Technik. Sie geht in die Frage, wer das System wofür nutzt.

Müssen wir uns zwischen lokaler KI und Cloud entscheiden?

Nein. Für viele Unternehmen ist eine bewusste Aufteilung die beste Lösung: Sensible und routinemäßige Aufgaben wie interne Dokumente, Kundendaten oder HR-Prozesse laufen lokal, Aufgaben ohne sensible Daten und mit hohem Aktualitätsbedarf über einen europäischen Cloud-Anbieter. Das Whitepaper beschreibt diese Hybrid-Strategie als eigenen Weg, nicht als Kompromiss zweiter Wahl.

Was passiert, wenn ein besseres Open-Source-Modell erscheint?

Dann wechseln Sie es. Die Open-Source-Gemeinschaft veröffentlicht laufend neue Modelle, und ein sauber aufgesetztes Deployment erlaubt den Wechsel ohne Unterbrechung des Betriebs. Genau darin liegt ein Unterschied zur Cloud: Dort entscheidet der Anbieter, wann ein Modell abgeschaltet oder verändert wird, hier entscheiden Sie es.

Zuletzt aktualisiert: