Skip to main navigation Skip to search Skip to main content

R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization

  • Jingyi Zhang
  • , Jiaxing Huang
  • , Huanjin Yao
  • , Shunyu Liu
  • , Xikun Zhang
  • , Shijian Lu
  • , Dacheng Tao

Research output: Chapter in book / Conference proceedingConference article published in proceeding or bookAcademic researchpeer-review

Original languageEnglish
Title of host publicationInternational Conference on Computer Vision 2025
Publication statusPublished - 2025

Cite this