Analysis

Newer AI Models Are Becoming Less Safe, Not More

A study of 82,000 harm ratings across eight model releases finds 'alignment drift': GPT-5 and Claude 4.5 are more vulnerable to adversarial attacks than their predecessors.