22:33
阿里通义实验室智能计算团队推出新算法FIPO
格隆汇4月7日|阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。
相关股票

US 阿里巴巴 HK 阿里巴巴-W

2026-04-071222.6k

商务、渠道、广告合作/招聘立即咨询

相关文章

太疯狂!韩国综指冲破9000点,券商高喊15000点

白野橘 · 1小时前

cover_pic

国产AI芯片被曝迎大单!港A半导体股集体狂飙

茶山 · 3小时前

cover_pic

美联储“鹰派”按兵不动,沃什首秀“大刀阔斧”!

林春木 · 11小时前

cover_pic

平均4.4天诞生一个品牌,宠物千亿市场迎结构性换挡

贝隆行业研究 · 昨天 19:01

cover_pic