多个模型独立作答,再由 Judge 综合和校验。
一次请求会分给多个参与模型。它们并行作答,可选地收集证据,最后由 Judge 处理分歧并生成结论。
答案、证据摘要、token 用量和成本记录会留在本地,方便复查。