三思而后行，让大模型推理更强的秘密是「THINK TWICE」

三思而后行，让大模型推理更强的秘密是「THINK TWICE」？
近年来，大语言模型（LLM）的性能提升逐渐从训练时规模扩展转向推理阶段的优化，这一趋势催生了「测试时扩展（test-time scaling）」的研究热潮。OpenAI 的 o1 系列与 DeepSeek 的 R1 模型已展示出显著的推理能
三思而后行，让大模型推理更强的秘密是「THINK TWICE」
admin8小时前
140