Kampf der Modelle – welches Modell wird gewinnen?
Arena AI lässt KI-Modelle anonym gegeneinander antreten. Christian Decker zeigt, warum es nicht das eine beste Modell gibt – sondern unterschiedliche Stärken für unterschiedliche Aufgaben.
Das beste Modell? Kommt auf die Aufgabe an.
Ein Modell kann hervorragende Bilder erzeugen und bei Recherche trotzdem schwächer sein. Arena AI macht diese Unterschiede über direkte Vergleiche, anonyme Abstimmungen und aufgabenspezifische Ranglisten sichtbar.

Sommerzeit ist die perfekte Zeit, um #Hitzefrei gemütlich im Schatten zu sitzen und andere für sich arbeiten zu lassen. Die Frage, die – oft auch sehr emotional geführt wird – ist, welches Modell das Beste ist. Dazu muss man klar sagen, dass es nicht „das Beste Modell“ gibt – alle Modelle haben ihre Stärken und ihre Schwächen – nur weil Modell A super Bilder erzeugen kann, muss dieses Modell nicht auch gut recherchieren können.
Auf der Infinity – einer der besten mehrtägigen Microsoft Konferenzen in Österreich – durfte ich einen Vortrag meiner sehr geschätzten MVP-Kollegin Tanja Wiehoff lauschen – extrem gut vorgetragen, mit viel Humor und sehr viel Wissen, gut strukturiert und mit für mich sehr wertvollem Inhalt.
Sie hat (unter anderem) ein Tool vorgestellt, dass viel zu wenig aus meiner Sicht kennen:

Arena.Ai
Mit diesem Tool kann ich sehr einfach AI-Modelle vergleichen. Und das Tool zeigt auch sehr gut, wie komplex der Vergleich zwischen den Modellen ist. Aber eins nach dem anderen:
Der Battle-Mode

Im Battle-Mode gebe ich einen Prompt ab und bekomme 2 Ergebnisse, die ich bewerten kann

Das spannende ist, ich sehe nicht, welches Tool das Bild erzeugt hat und bewerte quasi anonym, welches Ergebnis mir besser gefällt (Mein Titelbild hat der Copilot erstellt und das gefällt mir besser als die beiden hier). Nach meinem Vote sehe ich dann die Modelle:

Leaderboard
Basierend auf diesen Votes erstellt Arena.Ai ein Leaderboard

Und hier sieht man schon die Komplexität. Weil ich die Unterscheidung zwischen den Tätigkeiten habe und je Tätigkeit weiter unterschieden wird:
- Chat
- Text, Search, Vision, Document
- Code
- WebDev, Image-to-Webdev
- Image
- Text to Image, Image Edit
- Video
- Text-to-Video, Image-to-Video, Video Edit
Und damit es nicht zu einfach wird, gibt es pro Tätigkeit weitere Filter-Möglichkeiten, wie Kategorien, Lizenztypen usw.
Side by Side
Es gibt auch die Möglichkeit, einen Side by Side Mode auszuwählen, wo ich 2 Modelle meiner Wahl gegeneinander antreten lassen kann:

Und warum ist der Copilot nicht im Ranking ?
Diese Antwort ist sehr einfach: Weil der Copilot kein LLM ist. Sondern – wie es MS so schön schreibt – eine GUI für ein LLM ist. Wobei: „ein LLM“ ist ja nicht ganz richtig – dahinter stecken ja mehrere LLMs – derzeit ChatGPT und Claude.
Aber es gibt auch Microsoft-KI in der Liste. Bei den Bild-KIs liegt das Microsoft LLM – mai-image 2.5 auf Rank 6
Mein Dank geht noch mal an Tanja für den super Input!
Welches Modell überrascht euch?
Vergleicht ihr Modelle bereits systematisch oder entscheidet ihr aus Erfahrung? Weitere Sommerimpulse findet ihr in der Hitzefrei-Sammlung.