ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models4просмотрагод назад
Думать или нет? Избирательное рассуждение с помощью обучения с подкреплением для визуально-языковых2просмотрагод назад