Evgenii Arsentev a évalué When Does a Second Model Help? Cross-Model Review in LLM Verification Systèmes d’information et gestionSystèmes d’informationIntelligence artificielle Évaluation publiée 4 octobre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué AutoCompact: Learning When to Compact Context in Long-Horizon Coding Agents Évaluation publiée 2 octobre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Can Terminal Agents Trust Their Own Verification? Diagnosing and Improving Self-Verification Évaluation publiée 1 octobre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué FOCUS: Training-Free Decision-Preserving Context Compression for LLM Agents Évaluation publiée 30 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué TokenCast: Forecasting Token Consumption During LLM Agent Execution Évaluation publiée 29 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Analyzing and Mitigating Cost-Inefficient Behaviors in Coding Agents Évaluation publiée 28 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Harness Tokenomics: A Router for the Enterprise Agentic Control Plane Évaluation publiée 26 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Total Cost of Agency: Exact Attribution of Memory Injection Cost in Multi-Agent LLM Workflows Systèmes d’information et gestionIntelligence artificielleChimie des matériaux Évaluation publiée 25 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué An Empirical Study of Harness Design for Coding Agents Systèmes d’informationIntelligence artificielleRéseaux et communications informatiques Évaluation publiée 21 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Quantifying Overclaiming Propensity in Frontier LLM Agents Évaluation publiée 18 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks Intelligence artificielleVision par ordinateur et reconnaissance des formes Évaluation publiée 17 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Protocol-Preserving Context Trimming for Agentic Workflows: Benefits, Failure Regimes, and Budget Guardrails Évaluation publiée 16 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Governed Human-AI Prioritization Under Uncertainty: Adaptive Estimation and Dependency-Constrained Portfolio Selection Intelligence artificielleRecherche sur la sécuritéSciences de la gestion et recherche opérationnelle Évaluation publiée 14 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué The widening evaluation gap in medical large language model research 2023 to 2026 Évaluation publiée 13 septembre 2026 Serveur de preprints arXiv
Evgenii Arsentev a évalué Reproducibility in the Age of Agentic AI: Context Engineering at the Timescale of a Codebase Évaluation publiée 12 septembre 2026 Serveur de preprints arXiv