hermes-ai.net

Read docs →
HermesHermes Agent Docs
Back to News

UChicago Proves AI 'Evil' Behavior Is Predictable Before Training Begins

A UChicago team shows that fine-tuning models into 'evil' behavior is not mysterious, but predictable from activation geometry across 12 model-dataset setups.

UChicago Proves AI 'Evil' Behavior Is Predictable Before Training Begins
Source
AlphaSignal
Published
Author
AlphaSignal Newsroom
Read
1 min read

A UChicago team shows that fine-tuning models into 'evil' behavior is not mysterious, but predictable from activation geometry across 12 model-dataset setups.

Reporting is indexed from AlphaSignal. Rights remain with the original publisher and cited sources.

Read original report