mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)                                                         
$ whoami                                                                                                                

                                                                                                 

Karen Hambardzumyan

/ mahnerak
────────────────────────────────────────────── role PhD Student @ UCL NLP (University College London) advisors Supervised by amazing Jakob Foerster and Pontus Stenetorp employer AI Research @ Meta team Developing AI Research Agents at FAIR@MSL software Primary Maintainer of Aim previously Ex: YerevaNN, USC ISI, Yerevan State University mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ cat gold.txt AIRA₃ won Kaggle Gold in 2026 — to our knowledge, the first by an autonomous AI system mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ cat index.txt email ········@·····.··· github https://github.com/mahnerak google scholar https://scholar.google.com/citations?user=V3JjNJ0AAAAJ&hl=en semantic scholar https://www.semanticscholar.org/author/Karen-Hambardzumyan/5641536 orcid https://orcid.org/0000-0001-8764-9598 twitter https://twitter.com/mahnerak linkedin https://www.linkedin.com/in/mahnerak cv mahnerak-CV.pdf (Nov 2025) software Aim — experiment tracker software RandB0X — pre-container-era sandbox for secure code execution in competitive programming featured in Forbes featured in AI Accelerator Institute mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ ls -lt highlights/ 🥇 2026 AIRA₃ wins Gold in a live Kaggle competition NVIDIA competition, June 2026 · [announcement](x) Our autonomous AI research system finished 8th of ~4,000 teams in NVIDIA's live Kaggle competition on fine-tuning a 30B Nemotron model to reason better — to our knowledge the first gold medal won by an autonomous AI system. No human in the loop, graded externally on a private test set. Unlike a static benchmark it ran live against human experts with the same tools, so there was nothing to contaminate or game. Martin Josifoski*, Karen Hambardzumyan*, Edan Toledo*, Rishi Hazra*, Nicolas Baldwin*, Michael Kuchnik* 🚀 2026 AIRA₂: Overcoming Bottlenecks in AI Research Agents Preprint, 2026 Karen Hambardzumyan*, Nicolas Baldwin*, Edan Toledo*, Rishi Hazra*, Michael Kuchnik*, [+20] Bassel Al Omari, Thomas Simon Foster, Anton Protopopov, Jean-Christophe Gagnon-Audet, Ishita Mediratta, Kelvin Niu, Michael Shvartsman, Alisia Lupidi, Alexis Audran-Reiss, Parth Pathak, Tatiana Shavrina, Despoina Magka, Hela Momand, Derek Dunfield, Nicola Cancedda, Pontus Stenetorp, Carole-Jean Wu, Jakob Nicolaus Foerster, Yoram Bachrach, Martin Josifoski* 🏅 2025 AIRA₁: AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench NeurIPS 2025 (Spotlight) · [aira-dojo](github) Edan Toledo*, Karen Hambardzumyan*, Martin Josifoski*, Rishi Hazra, Nicolas Baldwin, [+20] Alexis Audran-Reiss, Michael Kuchnik, Despoina Magka, Minqi Jiang, Alisia Maria Lupidi, Andrei Lupu, Roberta Raileanu, Kelvin Niu, Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Michael Shvartsman, Shagun Sodhani, Alexander H. Miller, Abhishek Charnalia, Derek Dunfield, Carole-Jean Wu, Pontus Stenetorp, Nicola Cancedda, Jakob Nicolaus Foerster, Yoram Bachrach 📈 2023 Scaling Laws for Generative Mixed-Modal Language Models ICML 2023 Armen Aghajanyan*, Lili Yu*, Alexis Conneau, Wei-Ning Hsu, Karen Hambardzumyan, Susan Zhang, Stephen Roller, Naman Goyal, Omer Levy, Luke Zettlemoyer 🌀 2021 WARP: Word-level Adversarial ReProgramming ACL 2021 · [WARP](github) Karen Hambardzumyan*, Hrant Khachatrian and Jonathan May mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ ls -lt research/ ⚖️ 2026 AI Research Preference Models Preprint, 2026 Thomas Simon Foster*, Bassel Al Omari*, Tingchen Fu*, Thomas Mann, Carl Domond, [+28] Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily McMilin, Jakob Nicolaus Foerster 🧪 2026 AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents Preprint, 2026 · [airs-bench](github) Alisia Lupidi*, Bhavul Gauri*, Thomas Simon Foster*, Bassel Al Omari*, Despoina Magka*, [+32] Alberto Pepe, Alexis Audran-Reiss, Muna Aghamelu, Nicolas Baldwin, Lucia Cipolina-Kun, Jean-Christophe Gagnon-Audet, Chee Hau Leow, Sandra Lefdal, Hossam Mossalam, Abhinav Moudgil, Saba Nazir, Emanuel Tewolde, Isabel Urrego, Jordi Armengol Estape, Amar Budhiraja, Gaurav Chaurasia, Abhishek Charnalia, Derek Dunfield, Karen Hambardzumyan, Daniel Izcovich, Martin Josifoski, Ishita Mediratta, Kelvin Niu, Parth Pathak, Michael Shvartsman, Edan Toledo, Anton Protopopov, Roberta Raileanu, Alexander Miller, Tatiana Shavrina, Jakob Foerster, Yoram Bachrach ⚡ 2025 The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements NeurIPS 2025 Datasets and Benchmarks · [llm-speedrunner](github) Bingchen Zhao*, Despoina Magka*, Minqi Jiang*, Xian Li, Roberta Raileanu, [+18] Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Kelvin Niu, Shagun Sodhani, Michael Shvartsman, Andrei Lupu, Alisia Lupidi, Edan Toledo, Karen Hambardzumyan, Martin Josifoski, Thomas Foster, Lucia Cipolina-Kun, Abhishek Charnalia, Derek Dunfield, Alexander H. Miller, Oisin Mac Aodha, Jakob Foerster, Yoram Bachrach 🎮 2025 Combining Code Generating Large Language Models and Self-Play to Iteratively Refine Strategies in Games IJCAI 2025 Demo Track Yoram Bachrach*, Edan Toledo, Karen Hambardzumyan, Despoina Magka, Martin Josifoski, [+9] Minqi Jiang, Jakob Foerster, Roberta Raileanu, Tatiana Shavrina, Nicola Cancedda, Avraham Ruderman, Katie Millican, Andrei Lupu, Rishi Hazra 💡 2025 What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity Preprint, 2025 Alexis Audran-Reiss*, Jordi Armengol-Estapé, Karen Hambardzumyan, Amar Budhiraja, Martin Josifoski, [+15] Edan Toledo, Rishi Hazra, Despoina Magka, Michael Shvartsman, Parth Pathak, Justine T Kao, Lucia Cipolina-Kun, Bhavul Gauri, Jean-Christophe Gagnon-Audet, Emanuel Tewolde, Jenny Zhang, Taco Cohen, Yossi Adi, Tatiana Shavrina, Yoram Bachrach 🛡️ 2025 With Great Backbones Comes Great Adversarial Transferability Preprint, 2025 Erik Arakelyan*, Karen Hambardzumyan*, Davit Papikyan, Pasquale Minervini, Albert Gordo, Isabelle Augenstein, Aram H. Markosyan 💂 2025 Robust LLM safeguarding via refusal feature adversarial training ICLR 2025 Lei Yu*, Virginie Do, Karen Hambardzumyan, Nicola Cancedda 🔬 2024 LM Transparency Tool: Interactive Tool for Analyzing Transformer Language Models ACL 2024 Demo Track · [llm-transparency-tool](github) Igor Tufanov*, Karen Hambardzumyan, Javier Ferrando, Elena Voita 🧫 2022 BARTSmiles: Generative Masked Language Models for Molecular Representations Journal of Chemical Information and Modeling · [BARTSmiles](github) Gayane Chilingaryan*, Hovhannes Tamoyan*, Ani Tevosyan*, Nelly Babayan, Lusine Khondkaryan, Karen Hambardzumyan, Zaven Navoyan, Hrant Khachatrian, Armen Aghajanyan 🉐 2020 YerevaNN's Systems for WMT20 Biomedical Translation Task: The Effect of Fixing Misaligned Sentence Pairs WMT 2020 Shared Task Winner · [PARASITE](github) Karen Hambardzumyan*, Hovhannes Tamoyan and Hrant Khachatrian 🌐 2020 The Role of Alignment of Multilingual Contextualized Embeddings in Zero-Shot Cross-Lingual Transfer for Event Extraction CODASSCA 2020 Workshop · [zsee](github) Karen Hambardzumyan*, Hrant Khachatrian and Jonathan May 🧬 2019 BioRelEx 1.0: Biological Relation Extraction Benchmark BioNLP 2019 Workshop @ ACL · [BioRelEx](github) Hrant Khachatrian*, Lilit Nersisyan, Karen Hambardzumyan, Tigran Galstyan, Anna Hakobyan, Arsen Arakelyan, Andrey Rzhetsky and Aram Galstyan 🔍 2018 Natural Language Inference over Interaction Space As part of ICLR 2018 Reproducibility Challenge · [DIIN-in-Keras](github) Martin Mirakyan*, Karen Hambardzumyan and Hrant Khachatrian. 🚬 2018 Towards JointUD: Part-of-speech Tagging and Lemmatization using Recurrent Neural Networks CoNLL 2018 Shared Task · [JointUD](github) Gor Arakelyan*, Karen Hambardzumyan and Hrant Khachatrian. 🐎 2016 CleverHans v2.1.0 Adversarial Examples Library Technical Report · [cleverhans](github) Nicolas Papernot*, Fartash Faghri, Nicholas Carlini, I. Goodfellow, Reuben Feinman, Alexey Kurakin, Cihang Xie, Yash Sharma, T. Brown, Aurko Roy, Alexander Matyasko, Vahid Behzadan, Karen Hambardzumyan, [+13] Zhishuai Zhang, Yi-Lin Juang, Zhi Li, Ryan Sheatsley, Abhibhav Garg, Jonathan Uesato, W. Gierke, Y. Dong, David Berthelot, P. Hendricks, Jonas Rauber, Rujun Long, P. Mcdaniel mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $