mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)
$ whoami
⢀⣠⣴⣶⣶⣿⣿⣶⣶⣦⣄⡀
⢀⣴⣿⣿⣿⣿⣿⣿⣿⣿⣿⣿⣿⣿⣦⡀ Karen Hambardzumyan
/ mahnerak
⣰⣿⣿⣿⣿⣟⣉⣅⣤⡠ ⠉⠻⣿⣿⣿⣿⣆ ──────────────────────────────────────────────
⢰⣿⣿⣿⣿⣿⠷⡛⡻⣿⡅⠂ ⠘⣿⣿⣿⣿⡆ role PhD Student @ UCL NLP (University College London)
⣼⣿⣿⣿⣿⣿⣾⣧⣿⣿⡯⢐⣮⡆ ⣿⣿⣿⣿⣧ advisors Supervised by amazing Jakob Foerster and Pontus Stenetorp
⢻⣿⣿⣿⣿⣇⢄⣍⠟⡋⠄⢘⣞⠅⣸⣿⣿⣿⣿⡟ employer AI Research @ Meta
⠸⣿⣿⣿⣿⣇⠈⠁ ⢀⢠⣼⣞⣴⣿⣿⣿⣿⣿⠇ team Developing AI Research Agents at FAIR@MSL
⠹⣿⣿⡿⠿⢟⠋⠮⣞⢿⠷⠟⡂⡫⡹⢻⢻⠏ software Primary Maintainer of Aim
⠈⠑⢌⢌⠢⡂⢆⠢⡢⢡⠣⡱⡘⡬⠊ previously Ex: YerevaNN, USC ISI, Yerevan State University
⠁⠃⠕⠅⢇⢪⠢⠣⠑⠁
mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)
$ cat gold.txt
│ AIRA₃ won Kaggle Gold in 2026 — to our knowledge, the first by an autonomous AI system
mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)
$ cat index.txt
email ········@·····.···
github https://github.com/mahnerak
google scholar https://scholar.google.com/citations?user=V3JjNJ0AAAAJ&hl=en
semantic scholar https://www.semanticscholar.org/author/Karen-Hambardzumyan/5641536
orcid https://orcid.org/0000-0001-8764-9598
twitter https://twitter.com/mahnerak
linkedin https://www.linkedin.com/in/mahnerak
cv mahnerak-CV.pdf (Nov 2025)
software Aim — experiment tracker
software RandB0X — pre-container-era sandbox for secure code execution in competitive programming
featured in Forbes
featured in AI Accelerator Institute
mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)
$ ls -lt highlights/
🥇 2026 AIRA₃ wins Gold in a live Kaggle competition
│ NVIDIA competition, June 2026 · [announcement](x)
│
│ Our autonomous AI research system finished 8th of ~4,000 teams in NVIDIA's live Kaggle competition on
│ fine-tuning a 30B Nemotron model to reason better — to our knowledge the first gold medal won by an autonomous
│ AI system. No human in the loop, graded externally on a private test set. Unlike a static benchmark it ran live
│ against human experts with the same tools, so there was nothing to contaminate or game.
│
│ Martin Josifoski*, Karen Hambardzumyan*, Edan Toledo*, Rishi Hazra*, Nicolas Baldwin*, Michael Kuchnik*
🚀 2026 AIRA₂: Overcoming Bottlenecks in AI Research Agents
│ Preprint, 2026
│
│ Karen Hambardzumyan*, Nicolas Baldwin*, Edan Toledo*, Rishi Hazra*, Michael Kuchnik*, [+20]
│ Bassel Al Omari, Thomas Simon Foster, Anton Protopopov, Jean-Christophe Gagnon-Audet, Ishita Mediratta, Kelvin
│ Niu, Michael Shvartsman, Alisia Lupidi, Alexis Audran-Reiss, Parth Pathak, Tatiana Shavrina, Despoina Magka,
│ Hela Momand, Derek Dunfield, Nicola Cancedda, Pontus Stenetorp, Carole-Jean Wu, Jakob Nicolaus Foerster, Yoram
│ Bachrach, Martin Josifoski*
🏅 2025 AIRA₁: AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench
│ NeurIPS 2025 (Spotlight) · [aira-dojo](github)
│
│ Edan Toledo*, Karen Hambardzumyan*, Martin Josifoski*, Rishi Hazra, Nicolas Baldwin, [+20]
│ Alexis Audran-Reiss, Michael Kuchnik, Despoina Magka, Minqi Jiang, Alisia Maria Lupidi, Andrei Lupu, Roberta
│ Raileanu, Kelvin Niu, Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Michael Shvartsman, Shagun Sodhani,
│ Alexander H. Miller, Abhishek Charnalia, Derek Dunfield, Carole-Jean Wu, Pontus Stenetorp, Nicola Cancedda,
│ Jakob Nicolaus Foerster, Yoram Bachrach
📈 2023 Scaling Laws for Generative Mixed-Modal Language Models
│ ICML 2023
│
│ Armen Aghajanyan*, Lili Yu*, Alexis Conneau, Wei-Ning Hsu, Karen Hambardzumyan, Susan Zhang, Stephen Roller,
│ Naman Goyal, Omer Levy, Luke Zettlemoyer
🌀 2021 WARP: Word-level Adversarial ReProgramming
│ ACL 2021 · [WARP](github)
│
│ Karen Hambardzumyan*, Hrant Khachatrian and Jonathan May
mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)
$ ls -lt research/
⚖️ 2026 AI Research Preference Models
│ Preprint, 2026
│
│ Thomas Simon Foster*, Bassel Al Omari*, Tingchen Fu*, Thomas Mann, Carl Domond, [+28]
│ Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe
│ Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas
│ Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana
│ Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily
│ McMilin, Jakob Nicolaus Foerster
🧪 2026 AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents
│ Preprint, 2026 · [airs-bench](github)
│
│ Alisia Lupidi*, Bhavul Gauri*, Thomas Simon Foster*, Bassel Al Omari*, Despoina Magka*, [+32]
│ Alberto Pepe, Alexis Audran-Reiss, Muna Aghamelu, Nicolas Baldwin, Lucia Cipolina-Kun, Jean-Christophe
│ Gagnon-Audet, Chee Hau Leow, Sandra Lefdal, Hossam Mossalam, Abhinav Moudgil, Saba Nazir, Emanuel Tewolde,
│ Isabel Urrego, Jordi Armengol Estape, Amar Budhiraja, Gaurav Chaurasia, Abhishek Charnalia, Derek Dunfield,
│ Karen Hambardzumyan, Daniel Izcovich, Martin Josifoski, Ishita Mediratta, Kelvin Niu, Parth Pathak, Michael
│ Shvartsman, Edan Toledo, Anton Protopopov, Roberta Raileanu, Alexander Miller, Tatiana Shavrina, Jakob
│ Foerster, Yoram Bachrach
⚡ 2025 The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements
│ NeurIPS 2025 Datasets and Benchmarks · [llm-speedrunner](github)
│
│ Bingchen Zhao*, Despoina Magka*, Minqi Jiang*, Xian Li, Roberta Raileanu, [+18]
│ Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Kelvin Niu, Shagun Sodhani, Michael Shvartsman, Andrei Lupu,
│ Alisia Lupidi, Edan Toledo, Karen Hambardzumyan, Martin Josifoski, Thomas Foster, Lucia Cipolina-Kun, Abhishek
│ Charnalia, Derek Dunfield, Alexander H. Miller, Oisin Mac Aodha, Jakob Foerster, Yoram Bachrach
🎮 2025 Combining Code Generating Large Language Models and Self-Play to Iteratively Refine Strategies in Games
│ IJCAI 2025 Demo Track
│
│ Yoram Bachrach*, Edan Toledo, Karen Hambardzumyan, Despoina Magka, Martin Josifoski, [+9]
│ Minqi Jiang, Jakob Foerster, Roberta Raileanu, Tatiana Shavrina, Nicola Cancedda, Avraham Ruderman, Katie
│ Millican, Andrei Lupu, Rishi Hazra
💡 2025 What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity
│ Preprint, 2025
│
│ Alexis Audran-Reiss*, Jordi Armengol-Estapé, Karen Hambardzumyan, Amar Budhiraja, Martin Josifoski, [+15]
│ Edan Toledo, Rishi Hazra, Despoina Magka, Michael Shvartsman, Parth Pathak, Justine T Kao, Lucia Cipolina-Kun,
│ Bhavul Gauri, Jean-Christophe Gagnon-Audet, Emanuel Tewolde, Jenny Zhang, Taco Cohen, Yossi Adi, Tatiana
│ Shavrina, Yoram Bachrach
🛡️ 2025 With Great Backbones Comes Great Adversarial Transferability
│ Preprint, 2025
│
│ Erik Arakelyan*, Karen Hambardzumyan*, Davit Papikyan, Pasquale Minervini, Albert Gordo, Isabelle Augenstein,
│ Aram H. Markosyan
💂 2025 Robust LLM safeguarding via refusal feature adversarial training
│ ICLR 2025
│
│ Lei Yu*, Virginie Do, Karen Hambardzumyan, Nicola Cancedda
🔬 2024 LM Transparency Tool: Interactive Tool for Analyzing Transformer Language Models
│ ACL 2024 Demo Track · [llm-transparency-tool](github)
│
│ Igor Tufanov*, Karen Hambardzumyan, Javier Ferrando, Elena Voita
🧫 2022 BARTSmiles: Generative Masked Language Models for Molecular Representations
│ Journal of Chemical Information and Modeling · [BARTSmiles](github)
│
│ Gayane Chilingaryan*, Hovhannes Tamoyan*, Ani Tevosyan*, Nelly Babayan, Lusine Khondkaryan, Karen
│ Hambardzumyan, Zaven Navoyan, Hrant Khachatrian, Armen Aghajanyan
🉐 2020 YerevaNN's Systems for WMT20 Biomedical Translation Task: The Effect of Fixing Misaligned Sentence Pairs
│ WMT 2020 Shared Task Winner · [PARASITE](github)
│
│ Karen Hambardzumyan*, Hovhannes Tamoyan and Hrant Khachatrian
🌐 2020 The Role of Alignment of Multilingual Contextualized Embeddings in Zero-Shot Cross-Lingual Transfer for Event
Extraction
│ CODASSCA 2020 Workshop · [zsee](github)
│
│ Karen Hambardzumyan*, Hrant Khachatrian and Jonathan May
🧬 2019 BioRelEx 1.0: Biological Relation Extraction Benchmark
│ BioNLP 2019 Workshop @ ACL · [BioRelEx](github)
│
│ Hrant Khachatrian*, Lilit Nersisyan, Karen Hambardzumyan, Tigran Galstyan, Anna Hakobyan, Arsen Arakelyan,
│ Andrey Rzhetsky and Aram Galstyan
🔍 2018 Natural Language Inference over Interaction Space
│ As part of ICLR 2018 Reproducibility Challenge · [DIIN-in-Keras](github)
│
│ Martin Mirakyan*, Karen Hambardzumyan and Hrant Khachatrian.
🚬 2018 Towards JointUD: Part-of-speech Tagging and Lemmatization using Recurrent Neural Networks
│ CoNLL 2018 Shared Task · [JointUD](github)
│
│ Gor Arakelyan*, Karen Hambardzumyan and Hrant Khachatrian.
🐎 2016 CleverHans v2.1.0 Adversarial Examples Library
│ Technical Report · [cleverhans](github)
│
│ Nicolas Papernot*, Fartash Faghri, Nicholas Carlini, I. Goodfellow, Reuben Feinman, Alexey Kurakin, Cihang Xie,
│ Yash Sharma, T. Brown, Aurko Roy, Alexander Matyasko, Vahid Behzadan, Karen Hambardzumyan, [+13]
│ Zhishuai Zhang, Yi-Lin Juang, Zhi Li, Ryan Sheatsley, Abhibhav Garg, Jonathan Uesato, W. Gierke, Y. Dong, David
│ Berthelot, P. Hendricks, Jonas Rauber, Rujun Long, P. Mcdaniel
mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)
$