Werkwijze Alle edities ENNL

Weernabeschouwing

De weersverwachting, achteraf beoordeeld.

Gepubliceerd door VeriSky



Werkwijze

Hoe de beoordeling werkt en wat zij niet kan vertellen

Een verificatierapport is alleen de moeite waard als zichtbaar is hoe het tot stand kwam. Hier staat de volledige werkwijze, inclusief de beperkingen van de cijfers.

Wat wordt met wat vergeleken

Voor ieder uur bewaren we wat elk model voor dat uur voorspelde, op afstanden van één tot zeven dagen vooruit. Zodra het uur aanbreekt, vergelijken we de verwachting met een waarneming. Weernabeschouwing publiceert alleen een ranglijst als die waarneming onafhankelijk is van ieder model in de tabel.

Editie nr. 1 gebruikt temperatuur- en windrapporten van Schiphol en Rotterdam, geleverd door het NOAA Aviation Weather Center, en leest de gebeurtenisdag af van De Bilt, het referentiestation van het KNMI, dat elke tien minuten meldt via het KNMI Data Platform. Een rapport wordt alleen aan het dichtstbijzijnde hele uur gekoppeld als het binnen 20 minuten valt. Een stationsdag komt alleen in aanmerking als alle 24 uren een bruikbare temperatuur- en windwaarde bevatten.

De bredere scorer van VeriSky bewaart ook resultaten tegen de best-match-analyse van Open-Meteo wanneer geen stationsreeks bestaat. Die analyse is zelf een product van een weermodel. In Nederland komt zij uit op KNMI Harmonie en is zij dus geen onafhankelijke bron voor een openbare modelranglijst. Weernabeschouwing publiceert die analyseresultaten niet, en geen enkel cijfer op een rapportpagina komt eruit.

Hoe temperatuur en wind worden beoordeeld

De score gebruikt VeriSky's model Nauwkeurigheid + Extremen. De temperatuurnauwkeurigheid is het aandeel uren waarop de verwachting binnen 2 graden van de waarneming viel. De windnauwkeurigheid is het aandeel binnen 5 km/u, of binnen 20 procent van de waargenomen snelheid als die marge groter is. De score laat zo rechtstreeks zien hoe vaak een verwachting bruikbaar dichtbij zat.

Het onderdeel Extremen kijkt of een model uitzonderlijk warme, koude en winderige uren vond zonder steeds extremen te voorspellen die uitbleven. Bevat de steekproef minstens acht extreme en acht niet-extreme uren, dan telt dit onderdeel voor 30 procent en nauwkeurigheid voor 70 procent. In een rustigere steekproef bepaalt nauwkeurigheid de hele score. Naast iedere score blijft de wortel uit de gemiddelde kwadratische fout staan als gebruikelijke fout in graden of km/u; die fout wordt niet langer zelf naar een score omgerekend.

Regen wordt beoordeeld tegen de eigen regenmeter van het station, waar die de hele periode dekt. De meter meet wat de grond bereikte: een meting en geen modelanalyse, en juist die onafhankelijkheid maakt het rangschikken van regen mogelijk. Hij geeft de regen van het uur dat net voorbij is, en het archief bewaart de regen van een model op dezelfde manier, zodat beide kanten met dezelfde naam hetzelfde uur bedoelen.

Een uur telt aan beide kanten als nat vanaf een tiende millimeter, de kleinste hoeveelheid die het archief bewaart. Beide kanten krijgen een uur speling, zodat een regenzone die een uur te vroeg wordt verwacht een treffer is en niet een vals alarm plus een misser. Een uur zonder bruikbare aflezing wordt door niemand beoordeeld in plaats van als droog geteld, en de weggelaten uren staan onder de figuur.

Regen wordt beoordeeld op elke voorspelafstand van één tot zeven dagen, op elke afstand over dezelfde dagen: een dag komt alleen mee als de regenmeter kon worden afgelezen en elke run ervoor in het archief staat, zodat een kolom verandert met de afstand en nooit met de steekproef. Naast elke score staat de regen die die run voor die uren verwachtte. Zo doen ook de zelf verzamelde commerciële verwachtingen mee: hun uurcijfers volgen een andere tijdsafspraak, dus ze krijgen een hoeveelheid en nooit een score per uur. Er is geen rij voor hoe ver vooruit een model de regen al zag. Die vraag past bij een enkele hete dag, niet bij buien; editie nr. 3, die een hele natte week met een factor twee beoordeelde, blijft zoals ze is verschenen.

In de uurtabellen doet een model alleen mee aan een dag als zijn run alle 24 uren ervan dekt. Een model met een korte horizon kan daardoor uit een kolom vallen, maar kan nooit de steekproef verkleinen waarop de andere modellen worden beoordeeld. Regen op een punt blijft de moeilijkste vraag die deze publicatie stelt: een uur motregen is kleiner dan een modelvakje kan zien, en geen regencijfer hier is een oordeel over een heel land.

De gebeurtenis

Iedere editie opent met een gebeurtenis: de heetste volledige stationsdag van de periode, of een regenperiode die met haar begin- en einddatum wordt benoemd. Een hete dag is niet met de hand gekozen, hij rolt uit de stationsreeks, en de nummer twee staat erbij in de methodenotitie zodat de keuze controleerbaar is. Een regenperiode is wel een redactionele keuze, dus de methodenotitie benoemt haar, samen met de natste dag erbinnen en de natste dag van de hele periode wanneer die verschillen. De publieke modellen worden teruggespeeld uit de gearchiveerde run van 00 UTC van iedere voorafgaande dag, zodat ze allemaal dezelfde vraag op hetzelfde moment krijgen. Commerciële diensten hebben geen archief om terug te spelen en worden gelezen uit de verwachting die wij die dag hebben opgehaald, wat de editie bij hun kolommen vermeldt.

Het raster reikt steeds verder terug zolang er nog een model was dat de dag binnen de band had, en eindigt bij de eerste afstand waarop geen van hen dat had. Die laatste rij is precies waar het om gaat: daar houdt de gebeurtenis op te bestaan in wiens verwachting dan ook.

Een gebeurtenis per voorspelafstand lezen is een andere vraag dan een gemiddelde. Een model kan over zes weken het nauwkeurigst zijn en toch de ene dag verliezen die ertoe deed, en één gelukkige run is niet hetzelfde als de dag zien aankomen. Het hitteraster rekent een model daarom de langste ononderbroken reeks treffers binnen de marge aan, geteld vanaf één dag vooraf.

Hoe de gezamenlijke steekproef wordt gemaakt

Eerst komen alleen volledige stationsdagen in aanmerking. Een model moet minstens 95 procent van die uren leveren om kandidaat te worden. Daarna wordt de uiteindelijke tabel beperkt tot precies de doorsnede van stationsdagen die iedere kandidaat volledig leverde. Zo gebruikt iedere rij dezelfde plaatsen, datums en uren, niet alleen ongeveer hetzelfde aantal.

De hoofdtabel vergelijkt één voorspelafstand, meestal één dag vooruit. Verschillende afstanden samenvoegen zou korte modellen belonen die de moeilijkere latere dagen nooit hoeven te voorspellen. Grafieken per voorspelafstand houden die afstanden apart en stoppen een lijn als een punt minder dan 95 procent van de hoofdsteekproef bevat. Het exacte aantal uren staat bij de grafiekgegevens.

Welke modellen in aanmerking komen

Een rapportpagina rangschikt een korte, vaste lijst: het nationale model van het land dat zij beschrijft, één model van elk van de vier centra waarop de meeste Europese verwachtingen rusten, en het door machines geleerde model van ECMWF, dat dezelfde vraag beantwoordt zonder de natuurkunde op te lossen. Die selectie ligt per instituut vast voordat er ook maar één score is ingezien, zodat zij nooit een keuze achteraf kan zijn. Ieder ander open model dat op dezelfde uren is beoordeeld staat in de gegevensbijlage naast de pagina, zodat de keuze te toetsen is aan alles wat zij weglaat. Een toelatingslijst in de renderer geeft ieder model een expliciete naam, herkomst en toegankelijke kleur. Een onbekend model stopt de bouw van de editie.

Sommige nationale weerdiensten publiceren een seamless-product dat hun eigen model met hoge resolutie gebruikt waar dat bereik heeft, en daarbuiten het model van een ander centrum. Na die overdracht is de reeks niet meer de verwachting van dat land. Iedere editie meet het eigen bereik van het nationale model aan de dekking van het losstaande lid, publiceert daarbuiten niets onder de nationale naam, en zegt dat op de pagina. Bewijst het archief de overdracht door de accumulatoren van een ander model exact te herhalen, dan melden we dat ook.

Commerciële aanbieders worden wel beoordeeld maar niet in deze ranglijsten gepubliceerd. Verschillende licentievoorwaarden verbieden het rangschikken of vergelijken van hun uitvoer. In plaats van een willekeurige gedeeltelijke tabel publiceren we geen van die aanbieders.

Onze eigen verwachting

VeriSky publiceert een gemengde verwachting die modellen weegt naar hun recente scores. Die mix doet niet mee aan de aanbiedersranglijst van Weernabeschouwing. De publicatie mag de mix bespreken, maar laat het product van de uitgever niet om de koppositie strijden.

Wat de cijfers niet kunnen vertellen

De locaties zijn niet het hele land. Editie nr. 1 gebruikt twee luchthavenstations. Zij vormen geen gelijkmatig raster en vertegenwoordigen geen minima in het binnenland, kustwateren of ieder Nederlands weertype. Een model dat op die luchthavens sterk is, kan elders zwakker zijn.

Het filter voor volledige dagen verkleint de periode. Ontbrekende stationsrapporten en onvolledige modeldekking verwijderen hele stationsdagen. Iedere editie publiceert de behouden stations, dagen en uren, zodat omvang en geografie van het bewijs zichtbaar blijven.

Eén maand is één maand. Een model dat juli wint, heeft juli gewonnen. Verschillende weertypen bevoordelen verschillende modellen. Eén editie is geen blijvend oordeel over de kwaliteit van een model.

Scores hangen af van een gekozen schaal. De omzetting naar 0 tot 100 maakt modellen onderling vergelijkbaar, niet met een absolute norm voor goede verwachtingen. De onderliggende fout staat er altijd bij, zodat u onze schaal kunt negeren als u dat liever doet.

Reproduceerbaarheid en correcties

Iedere editie wordt gemaakt uit samenvoegbare dagelijkse accumulatoren in de scoringdatabase, niet uit een doorlopende schermtabel. De stationsdekking wordt uit de waarnemingsrijen afgeleid, niet uit een handmatig label. De gegevens waarop iedere pagina is gebaseerd worden ernaast gepubliceerd als data.json.

Edities worden niet stilzwijgend herschreven. Als iets niet klopt, herstellen we het, markeren we op de pagina wat en wanneer er veranderde en zetten we het bij correcties. Rapporten verschijnen pas nadat een maand volledig is afgelopen.