AssBench: Warum ein alberner LLM-Test verdammt nützlich ist
Ein Benchmark mit augenzwinkerndem Namen zeigt überraschend gut, wie moderne KI-Modelle mit komplexen, widersprüchlichen Design- und Programmieraufgaben umgehen.
Tags der Woche
Ein Benchmark mit augenzwinkerndem Namen zeigt überraschend gut, wie moderne KI-Modelle mit komplexen, widersprüchlichen Design- und Programmieraufgaben umgehen.
Metas neues KI-Modell Muse Spark 1.3 will agentische Arbeitsabläufe und Programmierung verbessern – mit weniger Tool-Aufrufen und geringerem Tokenverbrauch.