1 article
Researchers from Xiaomi besides Tsinghua University built CAPO, a reinforcement learning method that sharpens AI reasoning. The system trains in two steps - it first learns from correct examples then slowly adds wrong ones.
We use cookies to improve your experience on our site and to show you relevant advertising. To find our more, read our privacy policy and cookie policy