mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*)                                                         
$ whoami                                                                                                                

                                                                                                 

Karen Hambardzumyan

/ mahnerak
────────────────────────────────────────────── role PhD Student @ UCL NLP (University College London) advisors Supervised by amazing Jakob Foerster and Pontus Stenetorp employer AI Research @ Meta team Developing AI Research Agents at FAIR@MSL software Primary Maintainer of Aim previously Ex: YerevaNN, USC ISI, Yerevan State University mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ cat gold.txt │ AIRA₃ won Kaggle Gold in 2026 — to our knowledge, the first by an autonomous AI system mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ cat index.txt email ········@·····.··· github https://github.com/mahnerak google scholar https://scholar.google.com/citations?user=V3JjNJ0AAAAJ&hl=en semantic scholar https://www.semanticscholar.org/author/Karen-Hambardzumyan/5641536 orcid https://orcid.org/0000-0001-8764-9598 twitter https://twitter.com/mahnerak linkedin https://www.linkedin.com/in/mahnerak cv mahnerak-CV.pdf (Nov 2025) software Aim — experiment tracker software RandB0X — pre-container-era sandbox for secure code execution in competitive programming featured in Forbes featured in AI Accelerator Institute mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ ls -lt highlights/ 🥇 2026 AIRA₃ wins Gold in a live Kaggle competition │ NVIDIA competition, June 2026 · [announcement](x) │ │ Our autonomous AI research system finished 8th of ~4,000 teams in NVIDIA's live Kaggle competition on │ fine-tuning a 30B Nemotron model to reason better — to our knowledge the first gold medal won by an autonomous │ AI system. No human in the loop, graded externally on a private test set. Unlike a static benchmark it ran live │ against human experts with the same tools, so there was nothing to contaminate or game. │ │ Martin Josifoski*, Karen Hambardzumyan*, Edan Toledo*, Rishi Hazra*, Nicolas Baldwin*, Michael Kuchnik* 🚀 2026 AIRA₂: Overcoming Bottlenecks in AI Research Agents │ Preprint, 2026 │ │ Karen Hambardzumyan*, Nicolas Baldwin*, Edan Toledo*, Rishi Hazra*, Michael Kuchnik*, [+20] │ Bassel Al Omari, Thomas Simon Foster, Anton Protopopov, Jean-Christophe Gagnon-Audet, Ishita Mediratta, Kelvin │ Niu, Michael Shvartsman, Alisia Lupidi, Alexis Audran-Reiss, Parth Pathak, Tatiana Shavrina, Despoina Magka, │ Hela Momand, Derek Dunfield, Nicola Cancedda, Pontus Stenetorp, Carole-Jean Wu, Jakob Nicolaus Foerster, Yoram │ Bachrach, Martin Josifoski* 🏅 2025 AIRA₁: AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench │ NeurIPS 2025 (Spotlight) · [aira-dojo](github) │ │ Edan Toledo*, Karen Hambardzumyan*, Martin Josifoski*, Rishi Hazra, Nicolas Baldwin, [+20] │ Alexis Audran-Reiss, Michael Kuchnik, Despoina Magka, Minqi Jiang, Alisia Maria Lupidi, Andrei Lupu, Roberta │ Raileanu, Kelvin Niu, Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Michael Shvartsman, Shagun Sodhani, │ Alexander H. Miller, Abhishek Charnalia, Derek Dunfield, Carole-Jean Wu, Pontus Stenetorp, Nicola Cancedda, │ Jakob Nicolaus Foerster, Yoram Bachrach 📈 2023 Scaling Laws for Generative Mixed-Modal Language Models │ ICML 2023 │ │ Armen Aghajanyan*, Lili Yu*, Alexis Conneau, Wei-Ning Hsu, Karen Hambardzumyan, Susan Zhang, Stephen Roller, │ Naman Goyal, Omer Levy, Luke Zettlemoyer 🌀 2021 WARP: Word-level Adversarial ReProgramming │ ACL 2021 · [WARP](github) │ │ Karen Hambardzumyan*, Hrant Khachatrian and Jonathan May mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $ ls -lt research/ ⚖️ 2026 AI Research Preference Models │ Preprint, 2026 │ │ Thomas Simon Foster*, Bassel Al Omari*, Tingchen Fu*, Thomas Mann, Carl Domond, [+28] │ Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe │ Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas │ Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana │ Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily │ McMilin, Jakob Nicolaus Foerster 🧪 2026 AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents │ Preprint, 2026 · [airs-bench](github) │ │ Alisia Lupidi*, Bhavul Gauri*, Thomas Simon Foster*, Bassel Al Omari*, Despoina Magka*, [+32] │ Alberto Pepe, Alexis Audran-Reiss, Muna Aghamelu, Nicolas Baldwin, Lucia Cipolina-Kun, Jean-Christophe │ Gagnon-Audet, Chee Hau Leow, Sandra Lefdal, Hossam Mossalam, Abhinav Moudgil, Saba Nazir, Emanuel Tewolde, │ Isabel Urrego, Jordi Armengol Estape, Amar Budhiraja, Gaurav Chaurasia, Abhishek Charnalia, Derek Dunfield, │ Karen Hambardzumyan, Daniel Izcovich, Martin Josifoski, Ishita Mediratta, Kelvin Niu, Parth Pathak, Michael │ Shvartsman, Edan Toledo, Anton Protopopov, Roberta Raileanu, Alexander Miller, Tatiana Shavrina, Jakob │ Foerster, Yoram Bachrach ⚡ 2025 The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements │ NeurIPS 2025 Datasets and Benchmarks · [llm-speedrunner](github) │ │ Bingchen Zhao*, Despoina Magka*, Minqi Jiang*, Xian Li, Roberta Raileanu, [+18] │ Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Kelvin Niu, Shagun Sodhani, Michael Shvartsman, Andrei Lupu, │ Alisia Lupidi, Edan Toledo, Karen Hambardzumyan, Martin Josifoski, Thomas Foster, Lucia Cipolina-Kun, Abhishek │ Charnalia, Derek Dunfield, Alexander H. Miller, Oisin Mac Aodha, Jakob Foerster, Yoram Bachrach 🎮 2025 Combining Code Generating Large Language Models and Self-Play to Iteratively Refine Strategies in Games │ IJCAI 2025 Demo Track │ │ Yoram Bachrach*, Edan Toledo, Karen Hambardzumyan, Despoina Magka, Martin Josifoski, [+9] │ Minqi Jiang, Jakob Foerster, Roberta Raileanu, Tatiana Shavrina, Nicola Cancedda, Avraham Ruderman, Katie │ Millican, Andrei Lupu, Rishi Hazra 💡 2025 What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity │ Preprint, 2025 │ │ Alexis Audran-Reiss*, Jordi Armengol-Estapé, Karen Hambardzumyan, Amar Budhiraja, Martin Josifoski, [+15] │ Edan Toledo, Rishi Hazra, Despoina Magka, Michael Shvartsman, Parth Pathak, Justine T Kao, Lucia Cipolina-Kun, │ Bhavul Gauri, Jean-Christophe Gagnon-Audet, Emanuel Tewolde, Jenny Zhang, Taco Cohen, Yossi Adi, Tatiana │ Shavrina, Yoram Bachrach 🛡️ 2025 With Great Backbones Comes Great Adversarial Transferability │ Preprint, 2025 │ │ Erik Arakelyan*, Karen Hambardzumyan*, Davit Papikyan, Pasquale Minervini, Albert Gordo, Isabelle Augenstein, │ Aram H. Markosyan 💂 2025 Robust LLM safeguarding via refusal feature adversarial training │ ICLR 2025 │ │ Lei Yu*, Virginie Do, Karen Hambardzumyan, Nicola Cancedda 🔬 2024 LM Transparency Tool: Interactive Tool for Analyzing Transformer Language Models │ ACL 2024 Demo Track · [llm-transparency-tool](github) │ │ Igor Tufanov*, Karen Hambardzumyan, Javier Ferrando, Elena Voita 🧫 2022 BARTSmiles: Generative Masked Language Models for Molecular Representations │ Journal of Chemical Information and Modeling · [BARTSmiles](github) │ │ Gayane Chilingaryan*, Hovhannes Tamoyan*, Ani Tevosyan*, Nelly Babayan, Lusine Khondkaryan, Karen │ Hambardzumyan, Zaven Navoyan, Hrant Khachatrian, Armen Aghajanyan 🉐 2020 YerevaNN's Systems for WMT20 Biomedical Translation Task: The Effect of Fixing Misaligned Sentence Pairs │ WMT 2020 Shared Task Winner · [PARASITE](github) │ │ Karen Hambardzumyan*, Hovhannes Tamoyan and Hrant Khachatrian 🌐 2020 The Role of Alignment of Multilingual Contextualized Embeddings in Zero-Shot Cross-Lingual Transfer for Event Extraction │ CODASSCA 2020 Workshop · [zsee](github) │ │ Karen Hambardzumyan*, Hrant Khachatrian and Jonathan May 🧬 2019 BioRelEx 1.0: Biological Relation Extraction Benchmark │ BioNLP 2019 Workshop @ ACL · [BioRelEx](github) │ │ Hrant Khachatrian*, Lilit Nersisyan, Karen Hambardzumyan, Tigran Galstyan, Anna Hakobyan, Arsen Arakelyan, │ Andrey Rzhetsky and Aram Galstyan 🔍 2018 Natural Language Inference over Interaction Space │ As part of ICLR 2018 Reproducibility Challenge · [DIIN-in-Keras](github) │ │ Martin Mirakyan*, Karen Hambardzumyan and Hrant Khachatrian. 🚬 2018 Towards JointUD: Part-of-speech Tagging and Lemmatization using Recurrent Neural Networks │ CoNLL 2018 Shared Task · [JointUD](github) │ │ Gor Arakelyan*, Karen Hambardzumyan and Hrant Khachatrian. 🐎 2016 CleverHans v2.1.0 Adversarial Examples Library │ Technical Report · [cleverhans](github) │ │ Nicolas Papernot*, Fartash Faghri, Nicholas Carlini, I. Goodfellow, Reuben Feinman, Alexey Kurakin, Cihang Xie, │ Yash Sharma, T. Brown, Aurko Roy, Alexander Matyasko, Vahid Behzadan, Karen Hambardzumyan, [+13] │ Zhishuai Zhang, Yi-Lin Juang, Zhi Li, Ryan Sheatsley, Abhibhav Garg, Jonathan Uesato, W. Gierke, Y. Dong, David │ Berthelot, P. Hendricks, Jonas Rauber, Rujun Long, P. Mcdaniel mahnerak@fair.msl.meta in ~/Projects/mahnerak.com git:(master*) $