Temas en tendencia
#
Bonk Eco continues to show strength amid $USELESS rally
#
Pump.fun to raise $1B token sale, traders speculating on airdrop
#
Boop.Fun leading the way with a new launchpad on Solana.
Resulta que,
> GRPO está realizando la media aritmética --> escalado a nivel de token
> GSPO realiza la media geométrica --> escala a nivel de secuencia
Consulta el blog si no tienes tiempo para leer.

25 jul 2025
Nos enorgullece presentar Group Sequence Policy Optimization (GSPO), nuestro algoritmo de RL estable, eficiente y de alto rendimiento que impulsa el entrenamiento de RL a gran escala de los últimos modelos Qwen3 (Instruct, Coder, Thinking) 🚀
📄

64.01K
Populares
Ranking
Favoritas