Wie oft wertet ein Modell ein ganzes Bild richtig, wenn die Bedingungen schlecht sind? Der alte Test zeigte für jedes Modell 96–97 % und damit keinen Unterschied mehr. Dieser hier ist absichtlich schwer.
Die App arbeitet in zwei Stufen. Ein Bild zählt nur, wenn beide gelingen – hier stehen sie nebeneinander.
Anteil der Bilder je Gruppe – im entzerrten Bild, bei der App-Schwelle 0,3.
Darts im entzerrten Bild richtig, Mittel aller Kategorien. Die App nutzt heute 0,3.
Er nimmt echte Dartfotos, die kein Modell je im Training gesehen hat, und macht sie auf eine jeweils genau definierte Weise schwer: einmal nur der Blickwinkel, einmal nur das Licht, einmal nur die Bildqualität. So zeigt jede Kategorie eine einzelne Schwäche statt eines Mischwerts. Dazu kommen Kombinationen, unveränderte schwere Würfe und Fotos völlig fremder Boards.
Jedes Bild hat dieselben Störungen für jedes Modell – die Zufallswerte hängen nur am Bildnamen. Ein neues Modell lässt sich also jederzeit fair daneben stellen.
Gleiche Skala in allen Feldern, Modelle in zeitlicher Reihenfolge.
Je dunkler, desto besser. Umrandet ist der Bestwert der Zeile; „Spanne“ ist der Abstand zwischen bestem und schlechtestem Modell.