Table 16 Ablation on rollouts: factuality evaluations. We see increasingly better performance as the number of rollouts increase.
Slimpajama test set
(pointwise)
FActScore
(pairwise)
HaluEval
dialogue
HaluEval
QA
HaluEval
summarization
TruthfulQA
MC1
TruthfulQA
MC2
Llama Base36.650.050.050.150.022.435.9
Pretrain Baseline35.448.950.851.461.521.535.5
2 rollouts37.853.952.353.664.222.936.3
4 rollouts43.654.353.653.272.023.937.3
8 rollouts60.068.457.259.087.624.738.0
16 rollouts63.569.354.658.584.727.742.5
Table 17 Online DPO using different suffix judges. Evaluation results on standard benchmarks for quality when using GPT-OSS-120B as judge versus using our finetuned Llama3 judge during online DPO training. The number of rollouts used is 8 in these experiments.
Self-Improving Pretraining boolq piqa siqa hellaswag arc_challenge arc_easy obqa mmlu
fine-tuned Llama3 as judge67.576.143.849.835.469.328.626.9
GPT-OSS-120B as judge70.975.645.951.435.371.230.228.3
Table 18 Overall evaluation results for coherence and factuality ablations of whether we leverage the reference as a pivot to speed up pairwise comparison. The number of rollouts used is 8 in these experiments.
Pretraining for Quality Generation Quality Standard Evals Coherence Eval
8 rollouts, suffix as pivot72.149.667.7
8 rollouts, full comparisons84.351.186.8

Pretraining for Factuality Generation Quality Standard Evals Factuality Evals
8 rollouts, suffix as pivot64.249.655.7
8 rollouts, full comparisons83.150.356.9
Table 19 Evaluation results of factuality benchmarks for ablations of using pivots. The number of rollouts used is 8 in these experiments.
Pretraining for Factuality Slimpajama test set
(pointwise)
FActScore
(pairwise)
HaluEval
dialogue
HaluEval
QA
HaluEval
summarization
TruthfulQA
MC1
TruthfulQA
MC2
8 rollouts, suffix as pivot61.167.956.159.977.925.338.9
8 rollouts, full comparisons60.068.457.259.087.624.738.0
Table 20 Evaluation results of standard benchmarks for using pivots in different coherence and factuality ablations. The number of rollouts used is 8 in these experiments.
boolq piqa siqa hellaswag arc_challenge arc_easy obqa mmlu
Pretraining for Quality
8 rollouts, suffix as pivot68.075.843.849.833.769.128.428.2
8 rollouts, full comparisons70.975.645.951.435.371.230.228.3
Pretraining for Factuality
8 rollouts, suffix as pivot67.975.244.149.734.368.928.828.0
8 rollouts, full comparisons68.375.645.850.835.769.628.628.2