Apache Superset im Betrieb: die Werkzeuge, die fehlen
Apache Superset baut Dashboards schnell und schön. Sobald es aber produktiv läuft und mehrere Leute damit arbeiten, zeigt sich eine andere Seite: Im Betrieb bringt Superset erstaunlich wenig mit. Ich stoße im Kurs und in der Praxis immer wieder auf dieselben Lücken, deshalb habe ich mir die fehlenden Werkzeuge selbst gebaut. Hier ist der ehrliche Blick darauf, was fehlt.
Das Chaos, das von selbst entsteht
Am Anfang ist alles übersichtlich. Dann legen mehrere Leute eigene Abfragen und Charts an, jeder nennt die Dinge anders und niemand räumt auf. Nach ein paar Monaten sieht es so aus:
- Es gibt doppelte Datasets, die dasselbe sagen, nur weil 2 Leute unabhängig dieselbe Abfrage geschrieben haben.
- Man findet nichts wieder, weil Supersets Suche nur im Namen sucht, nicht in Beschreibung oder Abfragetext.
- Keiner traut sich, etwas zu ändern oder zu löschen, weil unklar ist, welches Chart auf welchem Dashboard daran hängt.
Das ist keine Frage von Disziplin, das passiert in jeder gewachsenen Installation. Superset liefert nur keine Werkzeuge mit, um es sichtbar zu machen und aufzuräumen.
Der gefährlichste Fehler: falsche Zahlen, die keiner sieht
Der Punkt, der mich am meisten beschäftigt, weil er so leise ist: Superset schneidet Ergebnisse an mehreren Stellen stillschweigend ab. Ein Chart hat ein Zeilenlimit und ein CSV-Export endet ohne die richtige Einstellung bei 10.000 Zeilen, jeweils ohne Warnung.
Die Folge ist tückisch. Das Dashboard zeigt kein Fehlerzeichen, sondern eine Zahl, die einfach zu klein ist. Die Geschäftsführung trifft eine Entscheidung auf einer Auswertung, die stumm abgeschnitten wurde. Deshalb gehört ein Wächter dazu, der meldet, wenn ein Chart aus seinem Limit herauswächst, bevor jemand einer falschen Zahl vertraut.
Governance heißt: darf ich das anfassen?
Die zweite große Lücke ist die Nachvollziehbarkeit. Vor jeder Änderung an einer Abfrage steht dieselbe Frage: Was hängt daran? Und vor jedem Aufräumen: Wird dieses Dataset überhaupt noch benutzt oder kann es weg?
Das lässt sich beantworten, wenn man die Abhängigkeiten von Charts, Dashboards und gespeicherten Abfragen zusammenführt, auch über Umwege wie Jinja-Makros, in denen nicht der Name, sondern die ID eines Datasets steht. Eine reine Namenssuche würde ein benutztes Dataset sonst als löschbar melden. Das Ergebnis ist eine Entscheidungshilfe mit Belegen, kein Ratespiel.
Empfehlungen, die die eigene Instanz prüfen
Zu Superset gibt es viele generische Ratschläge im Netz. Das Problem daran ist der fehlende Versionsbezug: Ein Tipp, der vor 2 Jahren galt, kann in Ihrer Fassung wirkungslos oder sogar falsch sein.
Deshalb ist mir wichtig, dass eine Empfehlung nicht behauptet, sondern prüft. Ein Beispiel: Der Schalter für den vollen CSV-Export lohnt sich nur, solange er nicht gesetzt ist, sonst ist er wirkungslos. Ob ein Feature-Flag bei Ihrem Datenbanktreiber überhaupt etwas bewirkt, hängt am Treiber. Eine gute Empfehlung schaut in die laufende Instanz, nennt den Beleg und sagt ehrlich, wo sie ohne Wirkung bleibt.
Und die Reports, die ohne Browser gar nicht gehen
Ein kleiner, aber typischer Stolperstein zum Schluss: Superset kann Dashboards als PNG oder PDF per Mail verschicken, aber nur, wenn im Hintergrund ein Browser steckt. Das offizielle Abbild bringt keinen mit. Ohne Browser meldet der Report Erfolg und verschickt nichts, oft ohne klare Fehlermeldung. Der Browser muss dabei im Hintergrund-Arbeiter sitzen, nicht nur im Webdienst, sonst hilft der Umbau nichts. Solche Details entscheiden, ob ein Report im Alltag zuverlässig ankommt.
Warum ich mir das selbst gebaut habe
Diese Lücken sind mir im Superset-Kurs und in der eigenen Umgebung so oft begegnet, dass ich aufgehört habe, sie zu umschiffen. Stattdessen ist eine kleine Sammlung von Werkzeugen entstanden, die genau diese Fragen beantwortet: Suche über den ganzen Inhalt, Abhängigkeiten und Verwendung, Dubletten, der Limit-Wächter, ein Blick auf Einstellungen und Instanz-Gesundheit mit belegten Empfehlungen, dazu ein Steckbrief, der alles zu einem Dataset auf einer Seite zeigt.
Bewusst so gebaut, dass es im Betrieb nicht stört: alles in einer einzigen Konfigurationsdatei, ohne eigenes Abbild, sodass es ein Update von Superset übersteht, standardmäßig nur für die Administratorrolle sichtbar und auch ohne JavaScript bedienbar. Der Punkt ist nicht das Werkzeug selbst, sondern was es über die Arbeit sagt: Wer die fehlenden Betriebswerkzeuge kennt und schließt, kennt Superset aus dem Alltag und nicht nur aus der Demo.
Superset sauber aufsetzen oder eine gewachsene Instanz aufräumen?
Ich richte Apache Superset self-hosted ein, binde Ihre Datenquellen an und bringe Ordnung und belastbare Zahlen in eine bestehende Installation. Mit genau den Werkzeugen, die im Betrieb fehlen.
Häufige Fragen
Was fehlt Apache Superset im Betrieb?
Vor allem Werkzeuge für Ordnung und Nachvollziehbarkeit: eine Suche über den gesamten Inhalt statt nur über den Namen, eine Übersicht der Abhängigkeiten, das Aufspüren von Dublett-Datasets, ein Blick auf stillschweigend abgeschnittene Ergebnisse und Empfehlungen zu Einstellungen und Instanz-Gesundheit.
Schneidet Superset Ergebnisse stillschweigend ab?
Ja. Charts haben ein Zeilenlimit und ein CSV-Export endet ohne die passende Einstellung bei 10.000 Zeilen, jeweils ohne Warnung. Das Dashboard zeigt dann unvollständige Zahlen, ohne dass es als Fehler auffällt.
Braucht Apache Superset eine eigene Governance?
Sobald mehr als ein paar Leute damit arbeiten, ja. Ohne Ordnung entstehen doppelte Datasets, verwaiste Abfragen und die Scheu, etwas zu ändern. Finden, Abhängigkeiten kennen und gefahrlos aufräumen sind die 3 Aufgaben, für die Superset von Haus aus wenig mitbringt.