Das Kalynda-Vorhersagemodell
Kalynda ist kein weiteres numerisches Wettermodell. Es nimmt die sechs vorhandenen und behält von jedem das Beste — die Mittelfristgüte von ECMWF, die feinskalige Auflösung von ICON über Europa, den schnellen Aktualisierungszyklus von GFS, das Verhalten von GEM in hohen Breiten, das Mesoskalen-Nest von Météo-France, die Grenzschicht- und Küstenstärke des Met Office — und kalibriert das Ergebnis am Live-METAR in Ihrer Nähe. Die eine Vorhersage, die dabei herauskommt, soll jede einzelne davon schlagen.
Warum überhaupt kombinieren
Jedes globale Modell löst dieselbe Physik mit anderem Gitter, anderer Startanalyse und anderer Parametrisierung. An ruhigen Tagen liegen sie einen Knoten auseinander. An wechselhaften Tagen können es 90° Windrichtung und 10 Knoten sein. Ein einzelnes Modell zu wählen heißt, dessen schlechte Tage mitzunehmen. Alle zu mitteln ist besser — aber ein einfaches Mittel lässt einen schlecht platzierten Lauf das Ergebnis mitziehen.
Schritt eins — robuste Gewichtung
Für jede Stunde nehmen wir die sechs Windvektoren und bilden ihren Median. Jedes Modell wird danach gewichtet, wie weit es davon entfernt liegt — mit einem Tukey-Biweight: Modelle nahe der Mitte behalten volles Gewicht, weiter entfernte verlieren rasch, ein extremer Ausreißer sinkt auf symbolische 5%, statt gestrichen zu werden. Nichts wird verworfen — ein einzelnes Modell kann recht haben — aber kein Lauf kann die Mischung dominieren.
Schritt zwei — Live-Kalibrierung
Robustheit allein hält jedes Modell für gleich glaubwürdig. Das ist es nicht. An einem bestimmten Tag über einem bestimmten Gelände trifft es mancher Lauf schlicht besser. Deshalb vergleichen wir die Vorhersage jedes Modells für die aktuelle Stunde mit der nächstgelegenen METAR-Station und bewerten den Fehler. Modelle, die die Beobachtung treffen, gewinnen Gewicht; abweichende verlieren es bis auf 35%. Das ist die Logik klassischer Model Output Statistics, angewandt auf eine einzelne Live-Beobachtung statt auf ein langes Archiv — deshalb ist sie sofort nutzbar.
Wo es aufhört
Die Kalibrierung läuft nur, wenn die Station etwa 55 km entfernt liegt und der Wind über 4 Knoten beträgt. Darüber hinaus dominiert lokales Gelände, und die Beobachtung ist kein Beleg mehr über die Modelle. Darunter ist die Richtung von Natur aus instabil; eine Bewertung daran fügt Rauschen statt Können hinzu. In beiden Fällen bleibt nur die robuste Gewichtung.
Die übrigen Größen
Temperatur, Taupunkt, Bewölkung, Niederschlag, Sicht und Druck werden genauso gemischt, aber als Skalare: Median, Biweight-Gewichte, gewichtetes Mittel. Wind wird als Vektor behandelt, weil die Richtung zirkulär ist — 350° und 10° arithmetisch gemittelt ergibt 180°, also genau die Gegenrichtung.
Was der Vertrauenswert bedeutet
Der Prozentwert verbindet zwei Dinge: wie einig sich die Modelle über die Richtung sind und wie weit ihre Geschwindigkeiten auseinanderliegen. Hoher Wert heißt, die Modelle erzählen dieselbe Geschichte und man kann darauf planen. Niedriger Wert heißt nicht, die Vorhersage sei falsch — sondern dass die Atmosphäre an einem Entscheidungspunkt steht und man kurz vor Abflug erneut prüfen sollte.
Was wir von jedem Modell übernehmen
Jedes Zentrum kann messbar etwas besser, und die Gewichtung nutzt genau das. ECMWF führt im mittelfristigen Bereich und hat nahezu keinen systematischen Windfehler — daher das größte Gewicht ab Tag 3 sowie bei Druck und Taupunkt. DWD ICON hat im Kurzfristbereich die niedrigsten Fehler gegenüber Bodenbeobachtungen und assimiliert im europäischen Radarverbund jeden Lauf Radardaten — dort trägt es die ersten zwei Tage, besonders bei Niederschlag und Böen. AROME (1,3 km) und UKV (1,5 km) liefern eigene Nebel- und Tiefwolkenfelder und tragen deshalb Sicht und Bewölkung über Frankreich und den Britischen Inseln. NOAAs HRRR nimmt über den USA alle 15 Minuten Radar auf und führt dort in den ersten Stunden bei Niederschlag und Böen. Kanadas GEM wurde im Mai 2026 zum ersten operationellen Hybrid aus Physik und maschinellem Lernen, mit maximalem Gewinn um Tag 5 bis Tag 10 — genau dort steigt sein Gewicht. Die Gewichte hängen zudem von der Variablen ab.
Wo wir bewusst zurückhalten
Verifikation zeigt auch, wo man einem Modell nicht trauen sollte. ECMWF schreibt selbst, die Erwartungen an sein Sichtfeld sollten niedrig bleiben, und es unterschätzt konvektive Böen teils um den Faktor zwei — beides bekommt wenig Gewicht. GFS hat über den USA einen dokumentierten Taupunkt-Trockenfehler und überschätzt leichten, unterschätzt starken Niederschlag. Das ARPEGE-Gitter dehnt sich von 5 km über Frankreich auf rund 24 km an den Antipoden — außerhalb Europas sinkt sein Gewicht deutlich. UKV-Daten treffen später ein und erhalten in den ersten Stunden einen Aktualitätsabschlag. GEM hat einen positiven Bodendruckfehler und unterschätzt Bewölkung. Kein Modell wird verworfen — jedes wird nur nach dem gefragt, was es gut beantwortet.
Ehrliche Grenzen
Kalynda erbt alle Fehler seiner Eingaben. Verpassen alle sechs Modelle eine Seebrise oder eine Leewelle, verpasst die Mischung sie auch. Es gibt keine Radarassimilation, kein Nowcasting und kein lokales Geländemodell. Es ist ein besserer Ausgangspunkt als ein Einzelmodell, aber kein Ersatz dafür, zum Himmel zu schauen, das TAF zu lesen und selbst zu entscheiden.
Modellquellen
ECMWF IFS · ECMWF AIFS · NOAA GFS · DWD ICON · CMC GEM · Météo-France ARPEGE · UK Met Office, alle über Open-Meteo. Beobachtungen vom NOAA Aviation Weather Center. Die Gewichte stützen sich auf veröffentlichte Verifikation: ECMWF TM931/TM928 und Forecast User Guide, DWD-Dokumentation zur Radarassimilation, Met Office RAL1/RAL3 (GMD), CNRM ARPEGE/AROME, ECCC GDPS/RDPS/HRDPS-Technotes und NOAA NCEP GFS/HRRR.