LLM Agents · Reinforcement Learning
2026Strategic LLM Agents with Solver-Guided Preference Optimization
Developed a solver-guided preference optimization framework combining game-theoretic solvers, counterfactual horizon rollouts, and LoRA adapter merging to improve strategic reasoning in 3B language models.