Publications
* denotes equal contributions
2026
-
Divide-and-Conquer Attacks on LLM Agents: Orchestrating Multi-Step Jailbreaks in Tool-Enabled Systems2026 -
A Systematic Assessment of Weak-to-Strong Confidence Prediction in Large Language ModelsTransactions on Machine Learning Research, 2026
2024
-
Weak-to-Strong Confidence PredictionIn NeurIPS 2024 Workshop on Statistical Foundations of LLMs, 2024