we-make.ai

Lokales LLM: KI ohne Abhängigkeiten

Sprachmodelle wie ChatGPT oder Claude sind mächtige Werkzeuge. Ihr Preis geht aber weit über die monatliche Rechnung hinaus: Sie geben Daten aus dem Haus und bauen auf einen Tech-Stack, der Ihnen nicht gehört. Diese Seite zeigt, wie der Betrieb auf eigener Hardware aussieht, was er verlangt und in welchen Schritten er entsteht.

Kostenloses Beratungsgespräch vereinbaren

Was bedeutet „lokales LLM“?

Ein lokales LLM (Large Language Model) ist ein Sprachmodell, das nicht in der Cloud eines externen Anbieters läuft, sondern auf Ihrer eigenen Hardware: in Ihrem Rechenzentrum, Ihrem Serverraum oder Ihrer privaten Infrastruktur. Die Daten, die Sie dem Modell übergeben, verlassen dabei niemals Ihre Kontrolle.

Für Geschäftsführer und Entscheider bedeutet das konkret: Sie bestimmen, welches Modell läuft, wer darauf zugreift und was mit den Daten passiert. Kein Anbieter kann Ihnen das entziehen oder verändern.

Die Vorteile eines lokalen LLM-Setups

Freier Tech-Stack

Ollama, vLLM und LM Studio sind quelloffen. Für die Software des Betriebs fällt damit keine Lizenzgebühr an, und kein Hersteller kann Ihnen die Grundlage unter dem Server wegziehen.

    Freie Modellauswahl

    Sie entscheiden, welches Modell läuft: Llama, Mistral, Gemma, Phi, Qwen, Granite oder ein Spezialmodell, das per Finetuning auf Ihr Unternehmen zugeschnitten ist. Und morgen wechseln Sie, ohne Aufwand und ohne Konsequenzen.

      Unabhängig von US-Tech und US-Politik

      Preise und Nutzungsbedingungen eines fremden Anbieters ändern sich, ohne dass Sie gefragt werden. Auf einem Server, der Ihnen gehört, ändert sich nichts über Nacht.

        24/7 ohne Token-Kosten

        Ein lokal betriebenes Modell läuft rund um die Uhr, und die Zahl der Anfragen steht auf keiner Rechnung. Kalkuliert wird einmal die Hardware und danach der Strom.

          Volle Datenkontrolle

          Ihre Daten verlassen Ihre Infrastruktur nie. Damit fällt die Frage weg, die jeden Cloud-Einsatz begleitet: welche Behörde welchen Rechtsraums am Ende Zugriff verlangen kann.

            Kein Vendor-Lock-in

            Wer heute auf einen Cloud-LLM-Anbieter setzt, ist morgen von dessen Preisen und Verfügbarkeit abhängig. Ein lokales Setup hält Sie dauerhaft frei.

              Woraus ein lokales Setup besteht

              Ein lauffähiger Aufbau hat vier Bestandteile, und keiner davon ist exotisch.

              Den Anfang macht die Laufzeitumgebung. Sie lädt die Modellgewichte und beantwortet Anfragen. Für den Einstieg und für einzelne Nutzer genügt Ollama. Sobald mehrere Abteilungen gleichzeitig arbeiten, übernimmt vLLM, das eingehende Anfragen bündelt und die Grafikkarte dabei deutlich besser auslastet.

              Über die mögliche Modellgröße entscheidet dann die Hardware, genauer der Grafikspeicher: Das Modell muss vollständig hineinpassen, andernfalls wird die Antwort zäh. Ein kompaktes Modell läuft auf einer einzelnen Workstation-Karte, ein großes verlangt mehrere Karten in einem Server. Welche Ausbaustufe was kostet, rechnet die Seite zur lokalen KI-Infrastruktur vor.

              Angebunden wird über eine Schnittstelle, die Sie schon kennen. Die gängigen Laufzeitumgebungen sprechen dasselbe Protokoll wie die bekannten Cloud-Anbieter, und Software, die heute gegen eine Cloud-API programmiert ist, verhält sich nach dem Umstellen der Adresse auf den eigenen Server unverändert.

              Bleibt das Wissen. Ein Modell allein kennt Ihre Prozesse nicht. Erst eine Knowledge-Base mit Retrieval Augmented Generation (RAG) macht daraus einen Kollegen, der Ihre Dokumente zitiert statt allgemein zu formulieren.

              Welche Modelle es gibt und wie sie rechtlich einzuordnen sind, klärt die Seite zu KI-Sprachmodellen aus Österreich.

              In vier Schritten in Betrieb

              Zuerst wird der Anwendungsfall festgelegt. Wie viele Menschen fragen wie oft, und wie lang sind die Texte? Aus diesen zwei Angaben ergibt sich die Modellgröße, und aus der Modellgröße ergibt sich alles Weitere.

              Danach wird auf Leihhardware gemessen. Ein bis zwei Wochen auf einer gemieteten GPU zeigen, ob das gewählte Modell die Aufgabe löst und wie schnell es antwortet. Das kostet einen Bruchteil der Anschaffung und verhindert den Fehler, Hardware für ein Modell zu kaufen, das die Aufgabe am Ende nicht kann.

              Erst dann wird die Maschine beschafft, entweder in den eigenen Serverraum oder ins Housing bei einem österreichischen Anbieter, je nachdem, wie Ihre IT heute aufgestellt ist. Auswahl, Bestellung und Inbetriebnahme übernehmen wir.

              Zuletzt geht der Betrieb über. Modellwechsel, Aktualisierungen der Laufzeitumgebung und ein Blick auf die Auslastung fallen dauerhaft an. Wer das im Haus behalten will, bekommt die Einschulung dazu; wer es abgeben will, gibt es an uns ab.

              Warum lokale LLM-as-a-Service-Anbieter nur die zweite Wahl sind

              In den letzten Jahren sind österreichische und europäische Anbieter entstanden, die Sprachmodelle für ihre Kunden hosten, als Alternative zu ChatGPT und Co. Das ist besser als ein US-Cloud-Dienst, es löst das grundlegende Problem aber nur zur Hälfte.

              Was diese Anbieter bieten: Die Daten bleiben in Europa, ein US-Konzern greift nicht darauf zu, die DSGVO-Lage ist damit sauber. Meist ist auch die Modellauswahl freier als bei den großen Cloud-Diensten.

              Was sie nicht lösen: Sie tauschen die Abhängigkeit von einem US-Konzern gegen die von einem europäischen Anbieter. Preis, Modellauswahl und Verfügbarkeit liegen weiterhin außerhalb Ihrer Kontrolle. Stellt der Anbieter den Betrieb ein oder erhöht er die Preise, stehen Sie vor demselben Problem wie zuvor, nur mit einem anderen Logo.

              Fazit: Für Unternehmen ohne eigene Serverinfrastruktur ist ein Hoster ein sinnvoller Einstieg. Als Dauerlösung für digitale Souveränität bleibt er ein Zwischenschritt.

              DIALOG.pro: Auch als vollständige On-Premise-Lösung verfügbar

              DIALOG.pro ist unsere eigene Sprachmodell-Anwendung, entwickelt nach österreichischen Datenschutzstandards und auch als vollständige On-Premise-Lösung für Ihr Unternehmen verfügbar.

              Ihre Daten. Ihre Infrastruktur.

              Sie bekommen damit einen erprobten, einsatzbereiten Aufbau, ohne ein Eigenentwicklungsprojekt dafür aufsetzen zu müssen, und behalten trotzdem die Kontrolle über Daten und Tech-Stack.

              Mehr über DIALOG.pro erfahren

              Vom Setup zum vollständigen KI-Service

              Das Setup ist der erste Schritt, und für sich genommen bringt es noch keinen Nutzen. Den bringt erst die Integration in die Vorgänge, die täglich anfallen, auf Wunsch mit österreichischem Serverhousing über unseren Partner ITandTEL. Was dazugehört, von der Beratung über die Konfiguration Ihres KI-Servers bis zum laufenden Betrieb, führt die Seite zur lokalen KI-Infrastruktur auf.

              Gratis-Download

              Kostenloses Whitepaper: Lokale KI für Unternehmen

              Bevor Sie in Hardware investieren: Das Whitepaper liefert Kostenmatrix, Break-even-Rechnung und den DSGVO-/CLOUD-Act-Rahmen für die Entscheidung lokale KI, kostenlos als PDF.

              Häufige Fragen zum lokalen LLM-Setup

              Was ist ein lokales LLM?

              Ein Sprachmodell, das auf Ihrer eigenen Hardware arbeitet und nicht bei einem Anbieter in der Cloud: im Rechenzentrum, im Serverraum oder in einer privaten Umgebung, die Ihnen gehört. Was das für die Kontrolle über Ihre Daten heißt, steht oben im Abschnitt „Was bedeutet lokales LLM?“.

              Welche Vorteile hat ein lokales LLM-Setup?

              Die sechs Punkte, die im Projekt regelmäßig den Ausschlag geben, stehen oben im Abschnitt „Die Vorteile eines lokalen LLM-Setups“. Den Ausschlag gibt dabei selten der Preis. Es ist meist der Umstand, dass niemand von außen bestimmt, welches Modell Sie morgen betreiben.

              Welche Modelle kann ich lokal betreiben?

              Praktisch jedes quelloffene Modell. Welche davon im Mittelstand üblich sind und wie frei sich später wechseln lässt, steht oben in der Karte „Freie Modellauswahl“.

              Was ist der Unterschied zwischen einem lokalen LLM-Hoster und einem echten On-Premise-Setup?

              Ein Hoster hält Ihre Daten in Europa, die Maschine gehört aber ihm. Warum das die Abhängigkeit verschiebt statt sie aufzulösen, steht oben im Abschnitt „Warum lokale LLM-as-a-Service-Anbieter nur die zweite Wahl sind“. Unser DIALOG.pro ist auch als On-Premise-Lösung verfügbar; alle Leistungen bündelt die Seite lokale KI-Infrastruktur.

              Ist der Aufbau eines lokalen LLM förderbar?

              Die Anfangsinvestition in Hardware und Einrichtung lässt sich für KMU mit Standort in Oberösterreich über DIGITAL.PLUS 26 um bis zu 35 % der Kosten senken, höchstens € 7.000. Dafür muss die Mitgliedschaft bei der WKO Oberösterreich aktiv sein. Antragsfrist ist der 2. November 2026.

              Bereit für echte KI-Souveränität?

              In einem kostenlosen Erstgespräch analysieren wir gemeinsam, welches LLM-Setup am besten zu Ihrem Unternehmen passt und wie Sie den Umstieg auf ein lokales Modell wirtschaftlich und technisch sauber umsetzen.

              Oder schreiben Sie uns direkt: [email protected]  |  +43 660 31 96 763

              Zuletzt aktualisiert: