Default

arXiv가 던진 경고: “에이전트는 똑똑해졌지만, 아직 믿고 맡길 단계는 아니다”

· News / AI

2026년 7월 arXiv에서는 LLM agent를 “더 잘 만들기”보다 “제대로 재기” 위한 벤치마크/평가 프레임워크 논문이 유독 많이 눈에 띄었습니다. 공통 결론은 단순합니다. 성공률은 생각보다 낮고, 길고 현실적인 워크플로우로 갈수록 급격히 무너진다는 것—이게 실무에 직격탄입니다.