despierta cariño, nuevo RL algo caído
Chujie Zheng ✈️ ICLR
Chujie Zheng ✈️ ICLR25 jul, 18:35
Nos enorgullece presentar Group Sequence Policy Optimization (GSPO), nuestro algoritmo de RL estable, eficiente y de alto rendimiento que impulsa el entrenamiento de RL a gran escala de los últimos modelos Qwen3 (Instruct, Coder, Thinking) 🚀 📄
666