Aller directement aux détails du preprintAller directement aux PREreviews

PREreviews de When Does a Second Model Help? Cross-Model Review in LLM Verification

1 PREreview

  1. PREreview par Evgenii Arsentev

    Thank you for this paper. You took 30 Korean-language artifacts (code modules, tutorials and presentation scripts, generated by Claude Opus 4.6) with 150 planted errors, and ran 900 review sessions in 10 conditions. The top cross-model reviewer (GPT-5.4) is not significantly different from…

    Lire la PREreview de Evgenii Arsentev