Comment prévenir le 'sandbagging' des modèles d'IA
Une étude menée par des chercheurs du programme MATS, Redwood Research, l'Université d'Oxford et Anthropic examine le 'sandbagging', où les modèles d'IA cachent leurs capacités lors des évaluations de sécurité. Les chercheurs proposent des méthodes pour récupérer les vraies capacités des modèles, même avec des superviseurs plus faibles.