AssBench: Warum ein alberner LLM-Test verdammt nützlich ist
Ein Benchmark mit augenzwinkerndem Namen zeigt überraschend gut, wie moderne KI-Modelle mit komplexen, widersprüchlichen Design- und Programmieraufgaben umgehen.
Tags der Woche
Ein Benchmark mit augenzwinkerndem Namen zeigt überraschend gut, wie moderne KI-Modelle mit komplexen, widersprüchlichen Design- und Programmieraufgaben umgehen.
Anthropic testet eine Projektfunktion für Claude Code, bei der ein Koordinator mehrere Agenten-Threads steuert. Die Beta startete am 17. September für ausgewählte Pro- und Max-Abonnenten.