we-make.ai

KI auf Tabellendaten: Prognosen & Klassifikation aus Unternehmensdaten

Aus ERP, CRM und Excel werden Vorhersagen. Machine Learning für strukturierte Daten

Die wertvollsten Daten eines Unternehmens stecken selten in spektakulären Bildern oder Texten. Sie stehen in nüchternen Tabellen: Aufträge im ERP, Kundenhistorien im CRM, Maschinendaten aus der Produktion, über Jahre gewachsene Excel-Listen. Genau diese strukturierten Daten geraten als Rohstoff für künstliche Intelligenz leicht aus dem Blick, dabei hängt an ihnen das Tagesgeschäft.

Diese Seite erklärt, was KI aus tabellarischen Daten herausholt und wovon die Wahl des Verfahrens abhängt. Danach geht es um den Weg vom vorhandenen Datenbestand zum produktiven Modell.

Was Tabellendaten sind und warum Vorhersagen aus ihnen nachvollziehbar bleiben

Tabellendaten sind matrixförmig organisiert: Jede Zeile ein Vorgang (eine Bestellung, ein Kunde, ein Messwert), jede Spalte ein Merkmal (Betrag, Datum, Kategorie, Temperatur). Anders als bei Bildern oder Freitext steckt die Bedeutung direkt in den Spalten. Das macht die Ergebnisse nachvollziehbar. Ein gutes Modell legt offen, welche Merkmale eine Vorhersage treiben, und genau das braucht jemand, der die Vorhersage im Betrieb verantworten soll.

Der Großteil aller im Mittelstand verfügbaren Daten liegt genau in dieser Form vor. Trotzdem werden sie meist nur für Berichte rückblickend ausgewertet, nicht, um nach vorne zu schauen.

Was KI aus Tabellendaten macht

Aus historischen strukturierten Daten lassen sich vier Arten von Mehrwert erzeugen:

  • Prognose (Forecasting): Absatzmengen, Materialbedarf, Liquidität oder Wartungszeitpunkte vorhersagen, etwa „Welche Maschine fällt wahrscheinlich in den nächsten Wochen aus?“ (Predictive Maintenance).
  • Klassifikation: Vorgänge automatisch einordnen, etwa Kunden mit Kündigungsrisiko (Churn) oder Aufträge, bei denen eine Verzögerung droht.
  • Anomalieerkennung: Auffälligkeiten finden, die kein Mensch in tausenden Zeilen sieht, etwa Fehlbuchungen oder Betrugsmuster.
  • Segmentierung: Kunden, Produkte oder Prozesse datengetrieben gruppieren, um Angebote und Ressourcen gezielter zu steuern.

Diese Aufgaben überschneiden sich oft mit klassischer digitaler Marktforschung, wenn es darum geht, aus Daten belastbare Aussagen über Kunden und Märkte abzuleiten.

Welches Verfahren wirklich am besten passt

In Gesprächen begegnet uns oft die Annahme, für KI sei „Deep Learning“ immer die beste Wahl. Für rein tabellarische Daten trifft das meist nicht zu. Auf strukturierten Daten arbeiten wir deshalb mit Gradient-Boosting-Verfahren wie XGBoost oder LightGBM, bei geringerem Datenhunger, schnellerem Training und besserer Erklärbarkeit als neuronale Netze.

Deep Learning spielt seine Stärke dort aus, wo Tabellendaten mit anderen Datentypen kombiniert werden, etwa Auftragsdaten plus Produktbilder oder Sensorzeitreihen plus Wartungsprotokolle. Dann lohnt der Aufwand eines neuronalen Netzes, das verschiedene Modalitäten gemeinsam verarbeitet.

Die ehrliche Antwort lautet daher: Das Verfahren richtet sich nach dem Problem, nicht umgekehrt. Welcher Ansatz für Ihren Anwendungsfall trägt, ist Teil eines sauberen AI Engineerings.

Der eigentliche Engpass: Datenqualität, nicht Algorithmen

In der Praxis entscheidet selten das Modell über Erfolg oder Misserfolg, sondern die Datengrundlage. Typische Stolpersteine:

  • Inkonsistente Erfassung: dieselbe Information in verschiedenen Schreibweisen oder Einheiten.
  • Lücken und Ausreißer, die ein Modell in die Irre führen.
  • Fehlende oder unsaubere Label bei Klassifikationsaufgaben.

Deshalb steht am Anfang keine Modellauswahl. Zuerst kommt eine nüchterne Bestandsaufnahme: Welche Daten liegen in welcher Qualität vor? Genau das leistet die Datenanalyse: Sie nimmt die Quellen auf und sagt, welche Frage der Bestand trägt. Erst danach beginnt die Modellarbeit, die auf dieser Seite beschrieben ist. Welche Entscheidung im Betrieb besser werden soll, klärt eine Stufe davor die Prozessanalyse.

Ihre Geschäftsdaten bleiben Ihre Geschäftsdaten

Tabellendaten sind oft besonders sensibel: Umsätze, Margen, Kundenbeziehungen. Der große Vorteil: Modelle für strukturierte Daten lassen sich vollständig auf eigener Infrastruktur trainieren und betreiben. Ihre Daten verlassen das Unternehmen nicht. Wie das technisch aussieht, beschreiben wir auf der Seite zur lokalen KI.

Vom Datenbestand zum produktiven Modell

Der Weg ist überschaubar und iterativ:

  1. Anwendungsfall schärfen: welche Entscheidung soll besser werden, und was wäre sie wert?
  2. Daten sichten und aufbereiten: Qualität prüfen, zusammenführen, bereinigen.
  3. Modell entwickeln und validieren: Verfahren wählen, an historischen Daten messbar testen.
  4. Produktiv einbinden: das Modell dort verfügbar machen, wo die Entscheidung fällt, und im Betrieb überwachen.

Für KMU in Oberösterreich sind solche Datenprojekte förderbar: über DIGITAL.PLUS 26 mit bis zu € 7.000.

Sie vermuten ungenutztes Potenzial in Ihren Daten? In einem kostenlosen Erstgespräch sehen wir uns an, welche Vorhersage oder Klassifikation sich aus Ihrem Datenbestand rechnet. Jetzt unverbindlich Kontakt aufnehmen

Häufige Fragen

Welche Daten eignen sich für KI auf Tabellendaten?

Praktisch alles, was in Zeilen und Spalten organisiert ist: Verkaufs- und Auftragsdaten aus dem ERP, Kundendaten aus dem CRM, Maschinen- und Sensordaten aus der Produktion, Buchhaltungsdaten oder schlicht historisch gewachsene Excel-Tabellen. Auf die Quelle kommt es dabei kaum an. Entscheidend ist, dass die Daten konsistent erfasst sind und genügend Historie enthalten.

Brauche ich für Tabellendaten Deep Learning?

Für Prognosen und Klassifikationen auf Tabellendaten ist ein neuronales Netz meistens nicht nötig, und ob Ihr Fall dazugehört, lässt sich vorab am eigenen Datenbestand ablesen. Steht alles, was für die Vorhersage zählt, bereits in Zeilen und Spalten, reicht ein Gradient-Boosting-Modell. Deep Learning lohnt sich erst, sobald etwas dazukommt, das keine Spalte fassen kann, ein Produktfoto etwa oder ein Freitextfeld aus dem Ticketsystem. Für den Betrieb zählt außerdem, wer das Modell danach betreut. Gradient Boosting trainiert auf einem gewöhnlichen Server und lässt sich für jede einzelne Vorhersage begründen, ein neuronales Netz verlangt mehr Hardware und mehr Erfahrung im Haus. Warum das so ist, steht auf dieser Seite im Abschnitt über die Verfahrenswahl.

Wie viele Daten brauche ich, damit sich ein Modell lohnt?

Es gibt keine feste Grenze, aber eine Faustregel: Je seltener das Ereignis, das Sie vorhersagen wollen, desto mehr Historie ist nötig. Für viele Prognose- und Klassifikationsaufgaben im Mittelstand reichen einige tausend sauber erfasste Datensätze. Wichtiger als die reine Menge ist die Datenqualität. Einheitlich erfasst müssen die Daten sein, und bei Klassifikationsaufgaben braucht es Label, die stimmen. Wie es darum in Ihren Systemen steht, beantwortet die vorgelagerte Datenanalyse.

Bleiben unsere Daten dabei im Haus?

Ja, ein Modell auf Tabellendaten lernt aus Ihrem eigenen Bestand; ein fremdes Modell, das Ihre Zahlen zu sehen bekäme, gibt es dabei nicht. Dazu kommt, wie wenig von Ihren Systemen dabei überhaupt angefasst wird: Für eine Vorhersage zählt ein Auszug der Spalten, an denen die Frage hängt, und nicht eine Kopie des ganzen ERP. Namen und Kundennummern gehören meist nicht dazu, denn zur Vorhersage tragen sie in der Regel nichts bei; gerechnet wird mit Beträgen, Mengen und Zeitpunkten. Welche Spalten es in Ihrem Fall sind, klärt die Datensichtung zu Beginn des Projekts.

Zuletzt aktualisiert: