Hitzefrei 2026 · Künstliche Intelligenz

Kampf der Modelle – welches Modell wird gewinnen?

Arena AI lässt KI-Modelle anonym gegeneinander antreten. Christian Decker zeigt, warum es nicht das eine beste Modell gibt – sondern unterschiedliche Stärken für unterschiedliche Aufgaben.

Das beste Modell? Kommt auf die Aufgabe an.

Ein Modell kann hervorragende Bilder erzeugen und bei Recherche trotzdem schwächer sein. Arena AI macht diese Unterschiede über direkte Vergleiche, anonyme Abstimmungen und aufgabenspezifische Ranglisten sichtbar.

Battle-ModeZwei unbekannte Modelle beantworten denselben Prompt. Erst nach der Bewertung wird aufgelöst.
Side by SideZwei selbst ausgewählte Modelle treten für einen direkten Vergleich gegeneinander an.
Merksatz: Nicht nach einem Gesamtsieger suchen, sondern das Modell passend zu Aufgabe, Kategorie und Rahmenbedingungen auswählen.
Illustration zum Vergleich verschiedener KI-Modelle

Sommerzeit ist die perfekte Zeit, um #Hitzefrei gemütlich im Schatten zu sitzen und andere für sich arbeiten zu lassen. Die Frage, die – oft auch sehr emotional geführt wird – ist, welches Modell das Beste ist. Dazu muss man klar sagen, dass es nicht „das Beste Modell“ gibt – alle Modelle haben ihre Stärken und ihre Schwächen – nur weil Modell A super Bilder erzeugen kann, muss dieses Modell nicht auch gut recherchieren können.

Auf der Infinity – einer der besten mehrtägigen Microsoft Konferenzen in Österreich – durfte ich einen Vortrag meiner sehr geschätzten MVP-Kollegin Tanja Wiehoff lauschen – extrem gut vorgetragen, mit viel Humor und sehr viel Wissen, gut strukturiert und mit für mich sehr wertvollem Inhalt.

Sie hat (unter anderem) ein Tool vorgestellt, dass viel zu wenig aus meiner Sicht kennen:

Startseite von Arena AI

Arena.Ai

Mit diesem Tool kann ich sehr einfach AI-Modelle vergleichen. Und das Tool zeigt auch sehr gut, wie komplex der Vergleich zwischen den Modellen ist. Aber eins nach dem anderen:

Der Battle-Mode

Battle-Modus in Arena AI

Im Battle-Mode gebe ich einen Prompt ab und bekomme 2 Ergebnisse, die ich bewerten kann

Zwei anonymisierte KI-Ergebnisse im direkten Vergleich

Das spannende ist, ich sehe nicht, welches Tool das Bild erzeugt hat und bewerte quasi anonym, welches Ergebnis mir besser gefällt (Mein Titelbild hat der Copilot erstellt und das gefällt mir besser als die beiden hier). Nach meinem Vote sehe ich dann die Modelle:

Auflösung der verglichenen KI-Modelle nach der Abstimmung

Leaderboard

Basierend auf diesen Votes erstellt Arena.Ai ein Leaderboard

Arena-AI-Leaderboard mit Ranglisten nach Anwendungsbereich

Und hier sieht man schon die Komplexität. Weil ich die Unterscheidung zwischen den Tätigkeiten habe und je Tätigkeit weiter unterschieden wird:

  • Chat
    • Text, Search, Vision, Document
  • Code
    • WebDev, Image-to-Webdev
  • Image
    • Text to Image, Image Edit
  • Video
    • Text-to-Video, Image-to-Video, Video Edit

Und damit es nicht zu einfach wird, gibt es pro Tätigkeit weitere Filter-Möglichkeiten, wie Kategorien, Lizenztypen usw.

Side by Side

Es gibt auch die Möglichkeit, einen Side by Side Mode auszuwählen, wo ich 2 Modelle meiner Wahl gegeneinander antreten lassen kann:

Side-by-Side-Vergleich zweier ausgewählter KI-Modelle

Und warum ist der Copilot nicht im Ranking ?

Diese Antwort ist sehr einfach: Weil der Copilot kein LLM ist. Sondern – wie es MS so schön schreibt – eine GUI für ein LLM ist. Wobei: „ein LLM“ ist ja nicht ganz richtig – dahinter stecken ja mehrere LLMs – derzeit ChatGPT und Claude.

Aber es gibt auch Microsoft-KI in der Liste. Bei den Bild-KIs liegt das Microsoft LLM – mai-image 2.5 auf Rank 6

Mein Dank geht noch mal an Tanja für den super Input!

Welches Modell überrascht euch?

Vergleicht ihr Modelle bereits systematisch oder entscheidet ihr aus Erfahrung? Weitere Sommerimpulse findet ihr in der Hitzefrei-Sammlung.

Christian Decker
Microsoft MVPChristian Decker