ai-labor-market

당신 일을 가장 잘 하는 AI가, 당신을 가장 잘 돕는 AI는 아니다

실제 업무 과제 7개 중 3개에서, 작업자 모델은 AI 조수 10개 중 어느 도움을 받았을 때보다 아무 도움도 받지 않았을 때 더 나은 점수를 받았습니다. UC 버클리의 새 벤치마크가 'AI가 내 일을 대신할 수 있는가'와 'AI가 내 일을 도울 수 있는가'를 분리해 측정했습니다.

글:편집자 겸 저자
게시일: 최종 수정:
AI 활용 작성저자 검토·편집 완료

실제 업무 과제 7개 중 3개에서, 작업자 모델은 AI의 도움을 전혀 받지 않았을 때 더 좋은 점수를 받았습니다. 시험 대상이었던 AI 조수 10개 중 어느 것의 도움을 받았을 때보다도요. "형편없는 조수를 붙였더니 더 나빠졌다"가 아닙니다. 가장 좋은 조언을 받았을 때보다 혼자 했을 때가 나았다는 뜻입니다. "AI가 당신을 대체하지는 않겠지만, AI를 쓰는 사람이 대체할 것"이라는 말을 위안 삼아 들어오셨다면, 2026년 8월 19일 UC 버클리 하스 경영대학원이 공개한 벤치마크는 그 문장을 태연하게 말하기 어렵게 만들었습니다.

논문 이름은 CentaurBench입니다. [사실] 지금까지의 리더보드가 하나로 뭉뚱그려온 두 가지를 분리해서 측정합니다. 모델이 당신의 일을 직접 해낼 수 있는가, 그리고 모델이 당신이 그 일을 하도록 도울 수 있는가.

하나로 묶여 있던 두 개의 질문

버클리 하스의 데이터 혁신·AI 연구소(DIAL) 소속인 파타라폰 케니 웡참차른, 크리스 굴라티, 민 민 퐁, 아비셰크 나가라지 네 사람은 의도적으로 비대칭적인 실험을 설계했습니다. [사실]

자동화 모드에서는 성능이 좋은 조수 모델이 과제를 직접 수행하고 완성된 결과물을 제출합니다. 증강 모드에서는 같은 모델이 결과물을 아예 만들지 않습니다. 대신 성능이 낮은 "작업자" 모델 — GPT-3.5-Turbo — 에게 줄 지침 텍스트를 작성하고, 최종 결과물은 그 작업자 모델이 만듭니다. [사실]

왜 이렇게 약한 작업자를 썼을까요. 저자들은 이유를 분명히 밝힙니다. GPT-3.5-Turbo가 "우리 파일럿 과제에서의 작업자 수행 수준에 근사하며", "멀티 에이전트 환경에서 실행 역할을 맡는 경우가 많은 저렴하고 성능이 낮은 모델을 대표한다"는 것입니다. [사실] 이 문장을 기억해 두세요. 이 결과를 어디까지 확장해서 읽을 수 있는지가 여기서 갈립니다.

과제는 7개, 퍼즐 난이도가 아니라 경제적 실질성을 기준으로 골랐습니다. 상담, 여행 계획, 식단 계획, 운영 연구(OR) 분석, 세무 신고 준비, 튜터링 수업 설계, 시장 동향 분석. 이 중 6개는 GDPval과 앤트로픽 경제 지수(Anthropic Economic Index)에서 가져왔고, 세무 신고 준비는 저자들이 직접 설계했습니다. [사실] 조수 모델은 Claude-Opus-4.8과 Gemini-3.1-Pro부터 GPT-3.5-Turbo 자신까지 총 10개가 평가됐습니다. 결과물은 과제별 채점 기준을 적용한 LLM 심사위원단이 블라인드 상태로 쌍대 비교했고, 10회 반복 실행했습니다. [사실]

두 능력은 따로 논다

두 모드에 모두 등장하는 조수 모델 9개를 놓고 보면, 자동화 능력과 증강 능력의 순위 상관은 ρ = 0.48이었습니다. [사실] 7개 과제 중 5개에서, 증강 부문 1위 모델은 자동화 부문 1위 모델과 다른 모델이었습니다. [사실] 자동화 부문 평균 순위 1위는 GPT-5-Mini였습니다. [사실]

여기서 헤드라인이 빠뜨릴 법한, 그리고 여러분이 의심해 봐야 할 대목이 있습니다. 저 ρ = 0.48에는 모델 9개 기준 양측 검정 p = 0.187이 따라붙습니다. [사실] 표본이 이 정도로 작으면, 이 결과는 "상관이 전혀 없다"와도 통계적으로 구별되지 않고, "상관이 꽤 강하다"와도 구별되지 않습니다. [추정] 정직하게 읽자면, 이 논문은 두 능력이 특정 과제에서 따로 놀 수 있다는 것을 보였을 뿐, 일반적으로 얼마나 느슨하게 연결돼 있는지를 확정한 것은 아닙니다.

도움이 오히려 해가 된 지점

과제별 결과는 상관계수보다 훨씬 직설적입니다. 운영 연구 분석, 세무 신고 준비, 여행 계획 세 과제에서는 도움을 받지 않은 작업자 모델이 모든 조수 조건을 하나도 빠짐없이 앞질렀습니다. [사실]

조수가 10개였는데, 혼자 내버려 두는 쪽이 그 전부를 이겼습니다.

7개 과제 전체를 합산했을 때 무지침 기준선보다 나은 평균 순위를 기록한 조수는 단 하나, GPT-5-Mini뿐이었고 그 차이도 근소했습니다. 3.66 대 3.79. [사실] 나머지 9개 조수는 평균적으로 작업자를 더 나쁘게 만들었습니다.

우리 데이터와의 교차 확인: 도움이 해가 된 과제가 곧 위험이 높은 과제였다

우리는 벤치마크 과제 7개를 우리 데이터베이스의 직업에 대응시키고, 각각의 자동화 위험도를 뽑아봤습니다. 나온 패턴은 예상과 달랐습니다.

조수의 도움이 역효과를 낸 세 과제의 자동화 위험도 평균은 우리 데이터 기준 48%입니다. 세무 신고 대행자 54%, 여행사 직원 58%, 운영 연구 분석가 32%. 반면 도움이 순손해를 내지 않은 네 과제의 평균은 20.5%입니다. 영양사 12%, 튜터 20%, 약물 중독 상담사 20%, 시장 조사 분석가 30%. [추정]

2.3배 차이입니다. 그리고 이 격차는 불편한 곳을 가리킵니다. AI가 당신의 일을 통째로 가져갈 가능성이 가장 높은 직업이, AI를 동료로 쓰기에는 가장 쓸모없는 직업일 수도 있다는 것입니다. [주장] "그냥 AI랑 같이 일하면 되지"라는 중간 지대가, 하필 사람들이 그 중간 지대에 가장 크게 기대고 있는 곳에서 가장 얇아 보입니다.

이 수치는 발견이 아니라 가설로 다뤄 주세요. 데이터 포인트가 7개뿐입니다. 위험도 점수는 논문의 것이 아니라 우리 자체 추정치입니다. 그리고 벤치마크 과제 하나를 직업 하나에 대응시키는 것 자체가 판단이 개입된 작업입니다. "식단 계획"은 영양사가 하는 일의 한 조각이지 직업 전체가 아닙니다. [추정]

당연히 나올 반론

이 연구의 작업자는 사람이 아니라 언어 모델입니다. 사람은 지침을 다르게 읽습니다. 뭔가 이상한 조언은 무시하고, 사백 번쯤 작성해 본 서식과 지시가 어긋나면 알아채고, 되묻습니다. GPT-3.5-Turbo는 그중 어느 것도 하지 않습니다. 그냥 따릅니다. 그러니 여기서 측정된 피해는 유능한 인간 전문가에게 벌어질 일의 상한선에 가까울 수 있습니다. [추정]

다만 이 반론은 보이는 것만큼 크게 먹히지 않습니다. 저자들이 그 작업자를 고른 이유가 바로, 지금 실제 기업의 에이전트 파이프라인에 배치되고 있는 저렴한 실행용 모델을 대변하기 때문입니다. 멀티 에이전트 시스템에 관한 한 이건 비유가 아니라 직접 측정입니다. [주장]

한 가지 단서를 더 붙이자면, 논문 자신의 수치를 논문에 되돌려 겨눈 것입니다. 심사위원 간 일치율은 6,265건의 비교에서 71.0%였는데, 이를 쪼개면 자동화 74.5%, 증강 67.8%입니다. [사실] 심사위원들은 증강 결과에 대해 덜 합의했고, 그렇다면 이 연구의 증강 쪽 절반이 더 잡음이 많은 절반이라는 뜻입니다. [추정]

준비 방식에서 무엇이 달라지는가

지침이 상황을 악화시킨 세 과제를 다시 봅시다. 세무 신고 준비, 운영 연구, 여행 예약. 공통된 모양이 있습니다. 검증 가능한 정답이 있는 규칙 기반 업무이고, 그럴듯하게 들리는 틀린 지시가 의심받는 대신 그대로 실행되는 종류의 일입니다. 열린 결말의 업무 — 상담 회기 계획, 튜터링 개요 — 에서는 나쁜 제안을 버리는 비용이 쌉니다. 규칙 기반 업무에서는 그 제안이 곧 결과물이 됩니다.

그래서 구체적으로 세 가지입니다.

리더보드를 구매 가이드처럼 읽는 것을 멈추세요. 자동화 벤치마크 1위 모델이 반드시 당신의 업무 실력을 올려주는 모델은 아니며, 이 논문이 그 격차에 대한 첫 실증입니다. 후보 도구는 당신의 실제 과제로, 당신의 실제 입력값으로 시험해 보세요.

정답을 확인할 수 있는 업무라면, 그럴듯함이 아니라 규정 원문에 대조해 검증하세요. 여기서의 실패 방식은 AI가 눈에 띄는 헛소리를 내놓는 것이 아닙니다. 맞게 읽히지만 틀린 것을 내놓는 것입니다.

유일한 예외에 주목하세요. 세무 신고 준비는 자동화 능력이 증강 능력을 강하게 예측한 단 하나의 과제였습니다(ρ = 0.85, p = 0.004). 그런데도 그 과제에서조차 도움 없는 작업자가 이겼습니다. [사실] 어느 모델이 가장 도움이 될지 예측할 수 있다는 것과, 그 모델이 실제로 도움이 된다는 것은 다른 이야기입니다.

이 중 어느 것도 AI 보조가 작동하지 않는다는 말은 아닙니다. "AI가 당신을 대체하지는 않겠지만…"이라는 모든 위로에 조용히 깔려 있던 그 전제 — 보조는 당연히 도움이 된다는 전제 — 가 이제 실제 업무 과제 7개로 시험받았고, 그중 4개를 온전히 통과하지 못했다는 말입니다. 이건 이 도구들을 피할 이유가 아닙니다. 도구의 이득을 믿음으로 받아들이기를 그만두고, 당신이 실제로 하는 일 위에서 직접 확인하기 시작할 이유입니다.

출처

  • Wongchamcharoen, P. K., Gulati, K., Fong, M. M., & Nagaraj, A. (2026). CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks. arXiv:2608.18554v1, 2026년 8월 19일 제출. UC 버클리 하스 경영대학원 데이터 혁신·AI 연구소(DIAL). https://arxiv.org/abs/2608.18554

교차 확인 섹션의 자동화 위험도 수치는 AI Changing Work 자체 직업 데이터셋에서 가져온 것이며, 인용된 논문의 수치가 아닙니다.


AI 보조 분석: 이 기사는 AI의 도움을 받아 작성했고 게시 전 검토를 거쳤습니다. CentaurBench에 귀속된 모든 수치는 논문 전문과 대조해 확인했으며, 7개 과제 위험도 비교는 우리의 자체 계산입니다.

본 분석은 Anthropic Economic Index, 미국 노동통계국(BLS), O*NET 직업 데이터를 기반으로 합니다. 방법론 자세히 보기

업데이트 이력

  • 2026년 8월 20일에 최초 게시되었습니다.
  • 2026년 8월 20일에 최종 검토되었습니다.

태그

#arxiv#benchmark#augmentation#automation#uc-berkeley#human-ai-collaboration#ai-labor-market

출처

  1. arxiv.org