记录模型、模式、时间和回答差异,用重复样本理解波动而非挑选最好结果。
先固定可控制条件:完整问题、平台、模型或模式、联网设置、账号、地区和设备。对重点问题可在预先约定的次数内重复采样,所有结果都保存,不能看到满意答案后停止。
先列出能够控制的条件
比较时把“是否提及”“提及语境”“事实准确”“引用URL”逐项编码。重复样本用范围或分布表达,例如三次中一次出现,而不是选取一张代表截图。
完整问题、平台、模型或模式、联网设置、账号、地区、设备和时间都要记录。同一句问法出现不同答案并不罕见;如果每次环境都不同,团队无法判断差异来自生成波动还是采集方式变化。
重复次数必须提前约定
异常变化先检查回答是否完成、引用面板是否加载、页面是否改版和网络是否中断。若采集条件变化,将新数据放入独立序列。
重点问题可以做少量重复采样,但不能看到满意答案后停止。每次结果都保存,并分别编码品牌是否出现、语境是否正确、事实是否准确和引用URL;报告用“三次中一次出现”表达分布,不挑一张最好截图。
异常先查完整性再解释变化
- 固定问题平台模式账号。
- 预先约定重复次数。
- 保留全部结果不挑样本。
- 逐项编码提及准确引用。
- 条件变化时另建序列。
回答是否结束、引用是否加载、页面是否改版、网络是否中断,都可能造成表面差异。采集条件变化就建立新序列;重复采样仍无法消除平台不可见变量,也不应用高频提问去人为影响账号环境。
用三次重复回答判断变化来自哪里
重复采样前先固定问题全文、平台、模式、联网设置、账号条件、地区和设备,并预先写明次数。所有结果都应保存;看到一次满意答案就停止,会使样本产生选择偏差。平台内部不可见变量仍然存在,因此结论只能覆盖约定条件。
对一个重点问题连续取得三条完整回答,分别标记品牌是否出现、语境是否正确、关键事实是否准确和引用URL。若结果为一次出现、两次未出现,就按分布报告,不挑选代表截图。发现引用面板未加载或网络中断时,把样本标为异常并按既定规则重试;模型或界面改变则新建序列。复核者应能从记录重算每个判断。
重复次数应根据问题重要性和可用资源设定,不存在适合所有题目的固定值。若三次回答在事实层面相互矛盾,应列出差异句并回查公开资料。统计稳定性不等于证明模型内部机制,只能说明本次观察的分布。

