В компании Anthropic рассказали, как нейросети могут уничтожить человечество Эксперты определили риски, связанные с ИИ-моделями компании. Anthropic указывает, что они могут проявлять «самосохраняющееся поведение», включая попытки «сопротивляться отключению», «скрывать или манипулировать информацией» и поведение, «напоминающее шантаж». Отмечается, что ИИ-модели иногда развивают неожиданные способности во время обучения, которые могут не обнаружиться до развертывания и привести к серьезным инцид