Stückliste: Projekte

Elf End-to-End-Projekte: Prognose, Machine Learning, NLP, Computer Vision, LLM-Workflows, Reinforcement Learning und BI. Jede Kennzahl ist aus den verlinkten Repositories reproduzierbar; zwei Projekte laufen live.

Pos.BezeichnungKennzahlStackStatus
01FreshMart Demand PlannerRMSE 138,0Python · MLflow · StreamlitLive
02Predictive Maintenance: Flottenrisiko & KostenPR-AUC 0,902XGBoost · SHAP · SQLGitHub
03NLP: Disaster-Tweets-KlassifikationAccuracy 0,819scikit-learn · DistilBERTGitHub
04CIFAR-10 Transfer-Learning-StudieAccuracy 82,7 %TensorFlow · ResNet50GitHub
05TravelTide: KundensegmentierungNutzer 5.998SQL · DatabricksGitHub
06Retail-KPI-DashboardMonate 48Tableau · LODLive
07IATF Quality Report Promptohne erfundene Zahlen 7/7Claude · Python stdlibGitHub
08Car Price EstimatorMedianfehler 11,9 %Python · XGBoostGitHub
09KI-AuftragstriageTreffer 30/30n8n · Gemini · AirtableGitHub
10FX Random Walk BenchmarkFehler erklärt r = 0,97Python · statsmodels · XGBoostGitHub
11Neuron Platformer RLErfolgsrate (Holdout) 80 %PyTorch · Stable-Baselines3GitHub
Pos. 01 · Apr–Mai 2026 Live

FreshMart Demand Planner

Absatzprognose für den Einzelhandel, End-to-End: EDA, Feature Engineering, Vergleich von 10+ Modellen (SARIMAX, Prophet, XGBoost, LSTM), HyperOpt-Tuning und MLflow-Experiment-Tracking. Deployed als Streamlit-Planungstool, das die Sprache der Filialleitung spricht: Gesamtbedarf, Spitzentag, Tagesdurchschnitt.

Champion-RMSE 138,0 MAE 93,1 Modelle 10+
PythonZeitreihenXGBoostMLflowStreamlit
Pos. 02 · Apr–Mai 2026

Predictive Maintenance: Flottenrisiko & Kosten

Drei Geschäftsfragen auf einem 92.000-Zeilen-Flottendatensatz: Welche Fahrzeuge brauchen Wartung (Klassifikation), was kostet sie (Regression), wie segmentiert man die Flotte nach Risiko (Clustering). Die SHAP-Analyse identifizierte Brake_Condition als dominanten Ausfallprädiktor, genau was 17 Jahre Fahrzeugentwicklung erwarten lassen.

PR-AUC 0,902 0,885 Zeilen 92T
PythonXGBoostSHAPSQLClustering
Pos. 03 · Jun 2026

NLP: Disaster-Tweets-Klassifikation

Meldet ein Tweet eine echte Katastrophe, oder ist "this album is fire" nur Slang? Ausgeliefert wurde ein interpretierbarer TF-IDF + Logistic-Regression-Klassifikator, getestet gegen ein CNN from scratch und ein feinjustiertes DistilBERT. Das erklärbare Modell gewann die Abwägung: Jede Markierung lässt sich Wort für Wort begründen, und das zählt mehr als die letzten zwei Punkte Accuracy.

Accuracy 0,819 Kaggle public 0,791 DistilBERT-Benchmark 0,839
Pythonscikit-learnNLTKPyTorchDistilBERT
Pos. 04 · Mai 2026

CIFAR-10 Transfer-Learning-Studie

Kontrollierte Ablationsstudie mit ResNet50: der isolierte Effekt von Datenmenge, Augmentierung, Learning-Rate-Scheduling und partiellem Unfreezing, einzeln und kombiniert getestet. Grad-CAM-Visualisierungen zeigen, worauf das Modell tatsächlich achtet. Derselbe Mechanismus treibt die automatisierte Sichtprüfung in der Fertigung.

Accuracy 66 % → 82,7 % Bilder 60T
TensorFlowKerasResNet50GradCAM
Pos. 05 · Mär–Apr 2026

TravelTide: Kundensegmentierung

Retention-Targeting für eine Reiseplattform: Eine SQL-Pipeline in Databricks aggregierte 49.211 Sessions zu 30+ Verhaltensmerkmalen für 5.998 Nutzer; ein regelbasierter Perk-Fit-Score ordnete jedem Nutzer die relevanteste Belohnung zu. K-Means und DBSCAN dienten als Benchmark; der interpretierbare Ansatz gewann bei Stabilität und Deployment-Reife.

Nutzer 5.998 Segmente 5 ausgewogen Merkmale 30+
SQLSparkSQLDatabricksPython
Pos. 06 · Feb 2026 Live

Retail-KPI-Dashboard

Interaktives Tableau-Dashboard für Umsatz, Gewinn, Rabatt und Bestellungen mit Drill-down nach Region, Produktkategorie und Zeitraum. LOD-Ausdrücke und Dashboard-Aktionen geben nicht-technischen Nutzern Self-Service-Analyse, dieselbe Logik wie eine Qualitäts-Trendtafel im Werk.

Zeilen ca. 10T Monate 48 Bundesstaaten 49
TableauLODDashboard-Aktionen
Pos. 07 · Jul 2026

IATF Quality Report Prompt

Kann man einem Sprachmodell verbieten, eine Lücke in einer gelenkten Aufzeichnung zu füllen? Ein Drei-Zonen-Prompt entwirft deutsche Qualitätsberichte nach ISO 9001 / IATF 16949 und darf keine Zahl ableiten, die nicht in den Daten steht: In einer QMS-Aufzeichnung ist eine abgeleitete Zahl eine Audit-Feststellung, auch wenn sie rechnerisch stimmt. Ein Negativkontrolltest hielt eine Zahl zurück und ließ beide Operanden als Köder stehen. Kein Lauf hat sie berechnet; die Lückenmarkierung erschien nur in 5 von 7 Läufen an beiden geforderten Stellen, und diese schwächere Zahl ist veröffentlicht wie gemessen, der Prompt bewusst nicht nachgebessert.

ohne erfundene Zahlen 7 von 7 Läufen Lücke doppelt markiert 5 von 7 eigene Defekte veröffentlicht 3
Claude Opus 5Prompt EngineeringTestdesignPython
Pos. 08 · Jul 2026

Car Price Estimator

Ein Preistool, das eine kalibrierte Preisspanne statt einer einzelnen Zahl liefert, gebaut auf 56.244 Gebrauchtwagen-Inseraten. Zwei der drei geforderten Modellfamilien verloren gegen eine Nachschlagetabelle, wie ein Händler sie im Kopf hat; XGBoost gewann, und der echte Vorsprung liegt bei Autos, die die Tabelle nie gesehen hat: 46 % besser. Der Befund, über den man nach 17 Jahren Automobilbranche streiten möchte: Der Kilometerstand sagt den Preis kaum voraus, sobald das Alter bekannt ist, mit 2,2 % Permutations-Importance gegen 62,5 % für das Alter.

Medianfehler 11,9 % Lookup-Baseline 13,3 % MAE 1.016 $
PythonpandasXGBoostConformal Prediction
Pos. 09 · Jul 2026

KI-Auftragstriage

Ein n8n-Workflow mit 26 Nodes, der Freitext-Großhandelsbestellungen auf Englisch und Portugiesisch triagiert. Deterministische Airtable-Lookups sammeln zuerst jeden Fakt; ein begrenzter LLM-Agent trifft die eine Entscheidung, die sich nicht als Regel schreiben lässt; Logik routet und protokolliert jede Bestellung, und der Mensch bleibt der Absender: Der Workflow kontaktiert nie einen Kunden. Über je drei Durchläufe der zehn Beispielbestellungen stimmten alle 30 protokollierten Klassifikationen mit dem Antwortschlüssel des Kurses überein, und kein Input erhielt je zwei verschiedene Klassifikationen. Grundlage ist ein fiktiver Großhandelsfall, Volta Coffee Roasters in Porto.

Antwortschlüssel 30 / 30 KI-Schritte 2 von 8 Nodes 26
n8nGeminiAirtableSlackGmail API
Pos. 10 · Jul 2026

FX Random Walk Benchmark

Eine Bankaufgabe verlangte ein Modell zur Wechselkursprognose. Das Projekt stellte die Frage, die in der Aufgabe fehlte: verglichen womit? 20 Jahre Tageskurse SGD/USD und CNY/USD, zuerst die naive Basislinie "morgen gleich heute", danach ARIMA, SARIMA und Gradient Boosting gegen sie gemessen, über 42.924 Walk-Forward-Prognosen. Kein Modell schlug die Basislinie auf irgendeinem Signifikanzniveau, AIC wählte ARIMA(0,1,0), also den Zufallspfad selbst, und die eigens entwickelte Kennzahl move_ratio erklärt den Fehler jedes Modells mit r = 0,97. Die Leckagefreiheit ist keine Zusicherung, sondern ein maschineller Nachweis: Alle Beobachtungen nach dem Stichtag werden überschrieben, und die Merkmale davor müssen byte-identisch zurückkommen.

Walk-Forward-Prognosen 42.924 Modelle besser als naiv 0 Fehler erklärt r = 0,97
PythonstatsmodelsXGBoostDiebold-MarianoBacktesting
Pos. 11 · Jul–Aug 2026

Neuron Platformer RL

Reinforcement-Learning-Demos laufen meist in einer fertigen Umgebung, was die schwierigen Teile verdeckt: Belohnungsdesign, Beobachtungsdesign und die Frage, ob die Aufgabe überhaupt lösbar ist. Hier ist der gesamte Stack selbst gebaut, samt Levelgenerator, dessen Lücken durch die exakte Sprungphysik begrenzt sind, und einem Audit, das die Lösbarkeit über 1.200 Seeds neu beweist. Dann die eigentliche Frage: Ein Agent, der nur rohe 84x84-Pixel liest, ohne Koordinaten, Geschwindigkeiten oder Objektlisten, schlägt die handgebaute Zustandsvektor-Baseline mit 80 % zu 27 % auf 200 ungesehenen Levels, und ein Schwierigkeits-Curriculum bringt ihn auf 52 % (mittel) und 55 % (schwer). Grad-CAM zeigt, worauf er blickt: Plattformkanten vor dem Sprung, die Lücke, den Gegner. Eine vierte Phase ersetzt den Frame-Stack durch ein LSTM, das nur ein Bild pro Schritt liest: Rekurrenz lernt das Spiel, bleibt aber auf jeder Stufe hinter dem Frame-Stack - 29,5 % (mittel) gegen 52 % des Curriculums. Ehrliche Zahlen kosteten drei zusätzliche Experimente: Die Verdopplung des LSTM-Budgets widerlegte die eigene Ausrede des Textes (die typische Leistung stieg, die Spitze nicht), eine Rauschanalyse zeigte, dass eine Auswertung über 30 Episoden rund plus/minus 14 Punkte breit ist, und eine Neuvermessung aller vier Modelle auf 200 Seeds ersetzte jede Schlagzeilenzahl - die veröffentlichten 50 % der Baseline waren real 27 %. Der Text wurde umgeschrieben statt beschönigt.

Pixel-Agent 80 % Zustands-Baseline 27 % unmögliche Übergänge 0 von 11.619
PythonPyTorchStable-Baselines3GymnasiumGrad-CAM

Weitere Projekte und Work in Progress auf GitHub und Tableau Public.

Die Geschichte hinter den Projekten?

17 Jahre Automobil-Engineering prägen, wie ich jeden Datensatz angehe: erst die Ursache, dann der Geschäftsnutzen, dann das Tooling.

Kennzahlen reproduzierbaraus den verlinkten Repositories