共 1 篇
同一个模型,推理深度可以按请求调节。本文讲清 reasoning.effort 的写法、各档位的适用场景、与 max_output_tokens 的配合,以及 effort 调错带来的成本与质量后果。