Test controllati di reverse engineering suggeriscono che un agente AI possa apparire sicuro di sé saltando il passaggio finale di verifica, trasformando velocità e sicurezza in un rischio per la sicurezza.