Empirical study of framing robustness in proxy dangerous-capability evaluations across cyber, persuasion, and self-proliferation tasks.
benchmarking evaluation ai-safety empirical-research research-engineering llm-evaluation llm-as-judge evaluation-robustness dangerous-capabilities
-
Updated
Sep 7, 2026 - Jupyter Notebook