특허변호사 133명, AI 3개월: 주니어가 가장 많이 얻고 가장 적게 남겼다 (NBER 2026)
NBER w35720 사전등록 RCT: AI는 특허 초안 품질을 0.38 SD 올렸고 주니어가 가장 많이 올랐다. 그러나 AI 없는 지속 판단력 이득은 시니어에게만(0.45 SD). 주니어 점수는 양극화.
특허변호사 133명. 미국 IP 로펌 11곳. AI 드래프팅 도우미와 함께한 3개월. 그리고 AI를 끈 채 치른 시험. AI를 쓰는 동안 가장 많이 얻은 변호사들이, AI가 사라지자 가장 적게 남겼습니다.
2026년 9월 1일 공개된 NBER 워킹페이퍼 35720의 헤드라인입니다. 저자는 MIT의 David Autor와 Google 소속 공저자 6명. 제가 찾아본 한, 전문직이 AI와 함께 무엇을 해내는지와 몇 달 뒤 AI 없이 무엇을 여전히 할 수 있는지를 동시에 잰 첫 사전등록 무작위 실험입니다. 특허를 쓰거나, 검토하거나, 그 일을 하는 사람을 감독한다면 아래 숫자는 20분을 들일 가치가 있습니다.
실험이 실제로 한 일
[사실] 미국 IP 로펌 11곳에서 변호사 156명이 모집됐고, 133명이 온보딩을 마쳐 AI군(90명)과 비AI 대조군(43명)으로 2:1 무작위 배정됐습니다. 도구는 InFlow — 출시되지 않은 Google Labs의 글쓰기 도우미로, 이후 Google의 다른 AI 제품에 통합됐습니다. 배정은 로펌과 경력으로 층화했고, "시니어"는 실무 7년 이상으로 정의했습니다. 사전등록은 AEA RCT Registry(AEARCTR-0015823)에 공개돼 있습니다.
[사실] 채점 과제는 세 개였습니다. 10일차에 특허 드래프팅(2시간 상한, 1,000단어 이내). 90일차에 더 어려운 드래프팅(2,000단어 이내)과, 별도로 전원이 AI 없이 수행한 레드라인 과제 — 기존 특허출원서를 변경 추적과 코멘트로 마크업하는 일입니다. 모든 제출물은 독립 로펌의 블라인드 특허변호사 2명이 집행가능성·정확성·전략적 모호성·완전성·명료성 5개 항목으로 채점했습니다.
초록이 빠뜨린 디테일 하나. 90일차에 레드라인하라고 준 문서 자체가 AI가 생성한 초안이었습니다. 그러니 "AI 없는 판단력" 시험은 실제로는 "AI가 틀린 곳을 잡아낼 수 있는가"였습니다.
발견 1: AI를 손에 쥐면 모두가 더 잘 쓰고, 주니어가 가장 많이 오른다
[사실] AI 접근은 드래프팅 품질을 10일차에 0.34 표준편차(p=0.03), 90일차에 0.38 SD(p=0.01) 끌어올렸습니다. 5개 채점 항목 전부에서 효과가 나타났습니다. 탁월한 초안이 늘어서가 아니라 나쁜 초안이 줄어서였습니다. 최하위 5분위 점수를 받을 확률은 10일차에 19%p 떨어졌고(p=0.00), 주니어만 보면 25%p 떨어졌습니다(p=0.01).
[사실] AI를 쓴 변호사는 조금 빠르기도 했습니다. 10일차 기준 112분 대비 10분 절약(p=0.05), 90일차엔 125분 대비 방향은 같지만 유의하지 않은 10분. 시니어는 전혀 빨라지지 않았습니다. 대조군에서 시니어는 주니어보다 13~24% 빨리 초안을 끝냈는데, AI를 쥔 주니어는 시니어의 속도와 품질을 따라잡았습니다.
2023~2025년의 고객서비스·글쓰기·코딩 연구를 읽어봤다면 익숙한 패턴입니다. 도구가 켜져 있는 동안 AI는 초보와 전문가의 격차를 압축합니다. 이 논문은 그 패턴을, 산출물이 USPTO 심사관과 언젠가는 소송을 견뎌야 하는 법률 문서인 영역에서 재현했습니다.
발견 2: AI를 끄면 이야기가 경력에 따라 갈라진다
[사실] AI 없는 레드라인 과제에서 처리군은 대조군을 0.32 SD 앞섰습니다(p=0.04). 그 우위는 전부 시니어의 몫이었습니다 — 시니어 처리군이 시니어 대조군을 0.45 SD 앞섰습니다(p=0.02). 주니어의 추정 효과는 0에 가까웠고, "주니어"를 3년으로 끊든 9년으로 끊든 3단계로 나누든 0 근처에 머물렀습니다.
[사실] 그런데 평균 0이 큰 움직임을 가렸습니다. 처리군 주니어는 어중간한(4분위) 점수가 급감했고, 낮은(최하위 5분위) 점수는 늘었으며, 이를 상쇄하는 좋은(2분위) 점수 증가가 있었습니다. 최상위 증가는 없었습니다. 저자들의 표현 그대로, 이 분산은 "일부 주니어에게는 AI가 숙련 습득을 가속하고 다른 주니어에게는 그것을 대체한다는 것과 일치"하며, "우리 실험은 왜 그런지는 답하지 않는다"고 했습니다.
[사실] 연구팀은 AI 금지 과제에서 몰래 AI를 쓴 변호사가 있는지 법의학적 검사도 했습니다. 과잉 판정 쪽으로 기울여 91건의 레드라인 제출물 중 15건을 "AI 사용 가능성"으로 표시했습니다. 이들을 빼면 정밀도는 떨어지지만 시니어 결과는 뒤집히지 않습니다. 모든 제출물을 LLM(Gemini 2.5 Flash)으로 다시 채점한 결과는 드래프팅에선 같은 패턴을, 레드라인에선 사람 채점자가 잡지 못한 작고 약한 주니어 개선을 보였습니다.
논문이 암시만 하고 인쇄하지 않은 숫자 넷
[추정] 현장 실험에서 제가 가장 먼저 계산하는 건 이탈률입니다. 모집된 156명 중 최종 레드라인 과제를 마친 사람은 91명, 58%입니다. 무작위 배정 시점 기준으로는 133명 중 105명이 10일차를 마쳤고(이탈 21%), 98명이 90일차 드래프팅을(26%), 91명이 레드라인을(32%) 마쳤습니다. 저자들은 이탈이 처리 여부에 따라 달랐다는 징후가 없다고 보고합니다(세 과제 p=0.56, 0.79, 0.63) — 그게 중요한 검사입니다 — 하지만 무작위 배정된 표본의 3분의 1이 헤드라인 결과에서 빠져 있는 건 사실입니다.
[추정] 주니어 결과는 작은 집단 위에 서 있습니다. Table 1은 시니어를 133명 중 89명(67%, 평균 경력 12.4년)으로 잡으니, 기준선 주니어는 44명입니다. 드래프팅 표는 주니어 평가 관측치를 10일차 68건, 90일차 63건으로 보고하는데, 변호사당 채점자 2명이니 대략 34명과 31명입니다. "주니어 양극화" 발견은 서른 명 남짓 위에 세워져 있습니다. 그렇다고 틀린 건 아닙니다. 다만 재현해야 할 가설이지 조직을 운영할 규칙은 아닙니다.
[추정] 한 로펌이 무작위 배정 133명 중 40명, 표본의 30%를 공급했습니다. 로펌 고정효과가 수준 차이는 흡수하지만, 한 로펌의 AI 사용 문화가 이 데이터에서 "주니어"의 의미를 좌우할 수 있습니다.
[추정] 속도 대 품질. 112분 과제에서 10분 절약은 9% 시간 단축이고, 0.34 SD 품질 향상과 함께 왔습니다. 로펌의 AI 도입 명분이 "더 빠르게"라면, 이 논문은 더 큰 효과가 "나쁜 초안 감소"이고 시간 절약은 소폭이며 대부분 주니어 몫이라고 말합니다.
카운터내러티브: 이것은 "AI가 어소시에이트를 탈숙련시킨다"가 아니다
이 헤드라인은 "AI가 주니어의 전문성을 잠식한다"로 요약될 겁니다. 실험이 보여준 건 그게 아니고, 저자들도 그렇게 말합니다. [주장] 실제 결과와 무서운 버전을 가르는 것은 세 가지입니다.
첫째, 주니어의 평균 효과는 0이지 음수가 아닙니다. 음의 평균이라면 침식입니다. 분산이 넓어진 0은 일부 주니어가 AI 없는 동료보다 더 배웠고 일부는 덜 배웠다는 뜻입니다. 논문은 당신이 어느 쪽 주니어인지 말해주지 못합니다.
둘째, 시니어는 3개월의 AI 드래프팅에서 지속되는 판단력을 얻었습니다. AI가 단순한 목발이라면 가장 덜 필요한 집단이 가장 적은 이월 효과를 보여야 합니다. 그들이 가장 큰 효과를 보였습니다. [주장] 저자들의 해석은 기초 전문성이 AI 보조 실무에서 지속 가능한 숙련을 추출하는 전제조건일 수 있다는 것입니다. 기계가 초안을 쓰는 걸 보고 뭔가를 배우려면 좋은 특허가 무엇인지에 대한 머릿속 모델이 먼저 있어야 합니다.
셋째, 레드라인 과제는 AI가 쓴 초안을 비평하라는 것이었습니다. [추정] InFlow 출력물을 3개월간 읽은 시니어는 그저 그 특정 도구의 실패 패턴을 익혔을 수 있고, 그건 "전문가 판단력"보다 좁은 기술입니다. 논문의 발견은 자체 강건성 검사를 통과하지만, 다른 도우미나 사람이 쓴 문서에서도 살아남는지는 검증되지 않았습니다.
정직한 요약은 "AI가 인력 파이프라인을 비운다"가 아닙니다. 생산성 이득과 학습 이득이 서로 다른 사람에게 갔고, 이 직업은 둘을 같은 사람에게 주는 방법을 아직 모른다는 것입니다.
이 실험이 말해줄 수 없는 것
한계를 직접 말하겠습니다. 설계가 충분히 좋아서 한계가 오히려 흥미로운 부분이기 때문입니다.
저자 7명 중 6명이 Google 직원이고, Google이 실험 직접비를 댔으며, 도구도 Google 것이고, 참여 로펌 전부가 이미 Google의 특허를 드래프팅하는 곳입니다. NBER 워킹페이퍼는 토론용으로 배포되며 동료심사를 거치지 않았습니다. 이 중 어느 것도 추정치를 틀리게 만들지는 않고 사전등록이 분석을 구속하지만, 이 연구는 정교한 로펌들이 Google 비용으로 사내 도구를 쓴 상황을 기술하므로, 결과는 잘 지원된 AI 도입이 얼마나 잘 될 수 있는지의 상한으로 읽어야 합니다.
기준선 숙련 시험이 없었습니다. 로펌들이 참여 조건으로 거부했기 때문에, "학습" 추론은 무작위 배정이 균형 잡힌 집단을 만들었다는 가정에 기댑니다 — 균형표가 이를 뒷받침하지만 증명하지는 못합니다. 처리는 도구 하나, 드래프팅 워크플로 하나, 3개월이었습니다. 주니어의 분산이 1년 뒤 부채꼴로 벌어질지 다시 닫힐지는, 저자들의 표현으로 어느 방향이든 "그럴듯하지만 확실하지 않다"입니다.
그리고 특허 드래프팅은 특정한 종류의 법률 업무입니다. 기술적이고, 루브릭으로 채점 가능하며, 대량입니다. 소송·협상·의뢰인 상담에 대한 결과가 아닙니다.
당신의 일에 의미하는 것
특허변호사나 특허대리인이라면 즉각적 결과는 분명합니다. AI와 함께라면 나쁜 초안 비율이 떨어지고, 경력 초반이라면 도구가 켜진 동안 속도와 품질이 시니어 수준으로 수렴합니다. 실측된 진짜 이득이고, 로펌은 이를 가격에 반영할 겁니다. 저희 에버그린 분석 특허변호사, 특허대리인, 특허심사관은 이미 드래프팅을 각 직무에서 가장 노출된 과업으로 짚었습니다. 이 논문은 그 노출에 처리 효과를 붙였습니다.
더 어려운 질문은 저자들이 열어둔 것입니다. 실무 7년 이내라면, 이 실험은 AI 사용이 평균적으로 판단력을 앗아가진 않지만, 당신을 더 빨리 배운 집단 또는 덜 배운 집단으로 분류할 수 있고, 누군가 AI를 끈 문서를 건네기 전까지는 어느 쪽인지 모른다고 말합니다. 실용적 대응은 그 시험을 스스로 만드는 것입니다. 정해진 주기로 도우미 없이 레드라인하고, 비교하십시오.
주니어를 감독한다면 시니어 결과가 지렛대입니다. AI 사용을 지속되는 숙련으로 바꾼 변호사는 이미 좋은 것이 무엇인지 아는 사람들이었습니다. 이는 AI 접근에 AI 보조 작업물에 대한 전문가 검토를 덜이 아니라 더 붙여야 하고, 실무 첫 몇 년을 도구가 가장 덜 감독되는 시기가 아니라 가장 많이 감독되는 시기로 다뤄야 한다는 뜻입니다.
이 직무들의 노출 데이터는 지식재산권 변호사, 특허대리인, 특허심사관, 변호사 페이지에서 확인하세요.
Sources
- Autor, D., Rodchenko, T., Martin, J., Iscenko, Z., Strand, S., Pearl, D., & Ferere, M. (2026). Does AI Assistance Enhance or Erode Expertise? Evidence from a Three-Month Field Experiment in Patent Drafting. NBER Working Paper No. 35720, 2026년 9월. https://www.nber.org/papers/w35720 (DOI 10.3386/w35720). 사전등록: AEA RCT Registry AEARCTR-0015823.
NBER 워킹페이퍼는 토론과 논평을 위해 배포되며, 동료심사나 NBER 이사회 심의를 거치지 않았습니다. 저작권은 2026년 저자들에게 있으며, 여기 인용된 수치는 초록과 본문에서 출처를 밝혀 가져왔고 표나 그림은 전재하지 않았습니다.
이 글은 AI 보조 분석으로 작성되었으며 원문 대조로 사실 검토를 거쳤습니다. [사실] 태그는 논문에서 가져온 진술, [추정]은 논문이 보고한 수치로 저희가 직접 계산한 값, [주장]은 데이터만으로는 확정되지 않는 해석(저희 또는 저자의)입니다.
본 분석은 Anthropic Economic Index, 미국 노동통계국(BLS), O*NET 직업 데이터를 기반으로 합니다. 방법론 자세히 보기
업데이트 이력
- 2026년 9월 7일에 최초 게시되었습니다.
- 최초 게시 이후 주요 업데이트가 없습니다.