🎉 O nosso artigo “𝐻𝑜𝑤 𝑡𝑜 𝑇𝑟𝑎𝑖𝑛 𝑌𝑜𝑢𝑟 𝐿𝐿𝑀 𝑊𝑒𝑏 𝐴𝑔𝑒𝑛𝑡: 𝐴 𝑆𝑡𝑎𝑡𝑖𝑠𝑡𝑖𝑐𝑎𝑙 𝐷𝑖𝑎𝑔𝑛𝑜𝑠𝑖𝑠” foi selecionado para uma 𝐨𝐫𝐚𝐥 no 𝗜𝗖𝗠𝗟 𝗪𝗼𝗿𝗸𝘀𝗵𝗼𝗽 𝗼𝗻 𝗖𝗼𝗺𝗽𝘂𝘁𝗲𝗿 𝗨𝘀𝗲 𝗔𝗴𝗲𝗻𝘁𝘀 na próxima semana! 🖥️🧠 Apresentamos o 𝐟𝐢𝐫𝐬𝐭 𝐥𝐚𝐫𝐠𝐞-𝐬𝐜𝐚𝐥𝐞 𝐬𝐭𝐮𝐝𝐲 𝐨𝐟 𝐜𝐨𝐦𝐩𝐥𝐞 𝐭𝐫𝐚𝐝𝐞-𝐨𝐟𝐟𝐬 entre SFT puro, RL puro e SFT+RL híbrido para agentes de múltiplos passos. SFT ➡️ RL empurra a fronteira de Pareto — e é a 𝐨𝐧𝐥𝐲 estratégia que fecha a lacuna com modelos fechados! 👇🧵
23,82K