AssBench: Warum ein alberner LLM-Test verdammt nützlich ist
Ein Benchmark mit augenzwinkerndem Namen zeigt überraschend gut, wie moderne KI-Modelle mit komplexen, widersprüchlichen Design- und Programmieraufgaben umgehen.
Tags der Woche
Ein Benchmark mit augenzwinkerndem Namen zeigt überraschend gut, wie moderne KI-Modelle mit komplexen, widersprüchlichen Design- und Programmieraufgaben umgehen.
Mit GPT-6 Astra läutet OpenAI die Ära der autonomen Computerbedienung ein. Doch hinter den beeindruckenden Benchmark-Zahlen und dem AGI-Raunen verbergen sich auch erhebliche Sicherheitsrisiken.