Ir para detalhes do preprintIr para avaliações PREreview

Avaliações PREreview de When Does a Second Model Help? Cross-Model Review in LLM Verification

1 PREreview

  1. Avaliação PREreview de Evgenii Arsentev

    Thank you for this paper. You took 30 Korean-language artifacts (code modules, tutorials and presentation scripts, generated by Claude Opus 4.6) with 150 planted errors, and ran 900 review sessions in 10 conditions. The top cross-model reviewer (GPT-5.4) is not significantly different from…

    Ler a avaliação PREreview de Evgenii Arsentev