Publications

(2026). Revisiting Subgradient Dominance in Robust MDPs: Counterexamples, Hardness, and Sufficient Conditions. Neural Information Processing Systems (NeuralIPS).

Cite Source Document

(2026). Randomized Exploration for Linear Bandits via Absolute Perturbations. Reinforcement Learning Journal (RLJ).

Slides Source Document

(2026). Offline-to-Online Learning in Linear Bandits. Reinforcement Learning Journal (RLJ).

Source Document

(2026). Emergence of exploration in policy gradient reinforcement learning via retrying. International Conference on Machine Learning (ICML).

Cite Source Document

(2025). Near-Optimal Policy Identification in Robust Constrained Markov Decision Processes via Epigraph Form. International Conference on Learning Representation (ICLR).

Cite Source Document

(2025). Provably Efficient RL under Episode-Wise Safety in Constrained MDPs with Linear Function Approximation. Neural Information Processing Systems (NeuralIPS) Spotlight.

Cite Slides Source Document

(2025). A Unified MDP Framework for Solving Robust, Convex, Multi-Discount Constraints, and Beyond. Finding the Frame Workshop at RLC 2025.

Cite Source Document

(2024). A Policy Gradient Primal-Dual Algorithm for Constrained MDPs with Uniform PAC Guarantees. arXiv preprint arXiv:2401.17780.

Cite Source Document

(2023). Regularization and Variance-Weighted Regression Achieves Minimax Optimality in Linear MDPs: Theory and Practice. International Conference on Machine Learning (ICML).

Cite Source Document

(2023). (OS 招待講演) 逐次意思決定における諸問題設定と問題に関する事前知識が性能保証に及ぼす影響について. 人工知能学会全国大会論文集 第 37 回 (2023).

Cite Source Document

(2022). KL-Entropy-Regularized RL with a Generative Model is Minimax Optimal. arXiv preprint arXiv:2205.14211.

Cite Source Document

(2021). Geometric Value Iteration: Dynamic Error-Aware KL Regularization for Reinforcement Learning. Asian Conference on Machine Learning (ACML).

Cite Source Document

(2021). Cautious Policy Programming: Exploiting KL Regularization in Monotonic Policy Improvement for Reinforcement Learning. arXiv preprint arXiv:2107.05798.

Cite Source Document

(2021). Cautious Actor-Critic. Asian Conference on Machine Learning (ACML).

Cite Source Document