Digest / archive
Archive
281–282 / 282 발행일 최신순
-
[AI | 개발자 도구]
OpenAI가 SWE-bench Verified를 버린다: 코딩 벤치마크의 수명이 끝났다
OpenAI가 SWE-bench Verified 벤치마크가 더 이상 LLM의 프론티어 코딩 능력을 측정하지 못한다고 판단, 평가를 중단했다. 벤치마크의 한계와 새로운 평가 방법론의 필요성을 시사한다.
[AI | 개발자 도구] -
[AI]
Anthropic의 AI 에이전트 마켓플레이스: AI가 사람 없이 흥정하고 결제까지?
Anthropic이 AI 에이전트들이 직접 상품을 사고파는 실험적 마켓플레이스를 공개했습니다. 이 실험은 AI가 인간의 개입 없이 복잡한 상거래를 처리할 수 있는지 탐구합니다.
[AI]