长任务该怎么挑模型

长任务失败通常不是因为模型不够聪明,而是上下文、耗时和预算没配好。先按任务形状挑,再看跑分。

先看这件事要读多少东西。要跨十几个文件改同一处逻辑,选上下文窗口大、长上下文里表现稳的;只改一个函数,小一点的模型更快也更省。

长任务里稳定比峰值重要。偶尔灵光但经常跑偏的模型,会把你的时间挪去收拾残局。同一条提示跑三次看方差,比看排行榜有用。

预算按任务算,不要按小时算。长任务会反复读文件、跑测试、重试,token 消耗不是线性的。设超时和步数上限,让它早点失败。

价格、上下文长度和可用模型都会变,以你账号页当天看到的为准,本页不写具体数字。该固定的是流程:小任务先试、看方差、设上限、diff 留给人审。