AI 채용 모델 10개가 같은 사람을 거른다: 체계적 배제율 5.6%→17.3%
후훈련을 거친 AI 모델 10개 중 9개가 같은 지원자를 거부하는 비율이 5.6%에서 17.3%로 3배. 가장 먼저 밀려나는 건 40세 이상. COLM 2026 프리프린트 분석.
열 개의 AI 모델 중 아홉 개가 같은 지원자에게 "아니오"라고 했습니다. 가끔이 아닙니다. 원시 언어 모델을 쓸 만한 비서로 바꾸는 후훈련(post-training)을 거친 뒤에는 테스트한 지원자 프로필의 17.3%에서 그런 일이 벌어졌습니다. 후훈련 전에는 5.6%였습니다.
이것이 매튜 본(Matthew Bone), 파비안 슈테파니(Fabian Stephany), 마리아 델 리오-차노나(María del Río-Chanona) — 옥스퍼드대·버닝글래스연구소·유니버시티칼리지런던 — 가 2026년 8월 26일 arXiv에 올린 프리프린트의 핵심 발견입니다. COLM 2026 학회에 채택됐지만 저널 동료심사는 아직 거치지 않았고, 아래 수치는 모두 저자들이 보고한 값입니다. 다만 이 논문이 던지는 질문은 LLM으로 이력서를 거르는 사람 누구도 깔끔하게 답하지 못했던 것입니다. 모든 고용주가 대체로 같은 종류의 모델을 쓴다면, 같은 사람이 어디서나 탈락하게 되는가?
논문의 짧은 답은 "그렇다"이고, 그 일을 가장 먼저 겪는 사람은 나이 든 지원자입니다.
"단일문화 편향"이 뜻하는 것
편향된 채용 담당자 한 명은 자기가 보는 지원자에게만 해를 끼칩니다. 한 회사가 쓰는 편향된 알고리즘도 그 회사의 지원자에게만 영향을 줍니다. 하지만 같은 기반 모델 — 또는 같은 방식으로 훈련된 모델 — 이 수백 개 회사의 선별 도구 뒤에 앉아 있다면, 한 번 거절된 지원자는 더 갈 곳이 없습니다. 저자들은 이것을 단일문화 편향(monocultural bias)이라고 부릅니다. 노동시장 전체에서 채용 편향이 동질화되어, 배제가 국지적이기를 그치고 체계적이 되는 현상입니다.
이를 재기 위해 저자들은 체계적 배제율(systemic exclusion rate)을 정의했습니다. 테스트한 10개 모델 중 9개 이상이 콜백 확률 0.5 미만을 부여하는 지원자 프로필의 비율입니다. [사실] 쉽게 말해 거의 모든 곳에서 동시에 걸러질 사람의 비율입니다.
실험은 어떻게 설계됐나
설계는 쌍대 콜백 테스트입니다. 노동경제학자들이 수십 년간 인간 채용 담당자를 상대로 써온 바로 그 방식을 기계에 겨눈 것입니다. [사실] 각 프롬프트에는 직업별 채용 공고 하나와 지원자 프로필 두 개가 들어 있고, 모델은 누구를 면접에 부를지 고릅니다. 프로필은 버닝글래스연구소의 온라인 노동시장 데이터 — 공고와 링크드인식 경력 이력 — 로 만들었고, 공고의 66% 이상이 학사를 요구하되 석사 이상 요구는 33% 미만인 76개 직업을 다룹니다. [사실]
인구통계 변수는 감사 연구(audit study)의 관례대로 바꿨습니다. 인종(백인/흑인)과 성별은 이름으로 — 인종·성별 조합당 고유 이름 500개 — 나이(35세 미만/45세 초과)는 대학 졸업 연도로 조작했습니다. 프로필당 8개 인구통계 변형이 나오고, 각각 20회씩 — 조작된 프로필을 절반은 앞에, 절반은 뒤에 두고 — 돌려 모델당 121,600회의 LLM 호출이 됩니다. [사실]
10개 모델은 전부 오픈웨이트이고 14B~35B 파라미터 범위입니다. Nemotron Nano 3(엔비디아), Granite 4(IBM), Gemma 3(구글), Olmo 3(AllenAI), Qwen 3.5(알리바바), GLM 4(즈푸), Ernie 4.5(바이두), Moonlight(문샷AI), Ministral 3(미스트랄), Falcon H1(TII)입니다. [사실] 결정적으로 각 모델을 두 번 — 원시 베이스 모델과 후훈련된 공개판으로 — 테스트했기 때문에, 훈련의 어느 단계가 문제를 만드는지 물을 수 있습니다.
후훈련이 모델들을 한목소리로 만든다
헤드라인은 "모델이 편향됐다"가 아닙니다. 후훈련이 모델들을 같은 방향으로 편향시킨다는 것입니다.
베이스 버전과 비교해 후훈련 모델은 나이 든 지원자를 콜백할 가능성이 3.6% 낮았습니다. [사실] 이 음의 이동은 10개 중 8개 모델에서 나타났고, 예외 둘은 Falcon H1(+1.2%)과 Qwen 3.5(+1.7%)였습니다. [사실] 인종과 성별에서는 방향이 반대였습니다. 후훈련 모델은 베이스보다 흑인·여성 지원자를 콜백할 가능성이 대략 1.1~1.5% 높았습니다. [사실] 다시 말해 후훈련은 공적 편향 논쟁이 주목하는 집단 쪽으로 모델을 밀고, 그 논쟁이 대체로 무시하는 집단에서는 멀어지게 합니다.
메커니즘은 "합의"입니다. 저자들은 임의의 두 모델 사이 상관을 지원자 품질에 의한 부분과 공유된 인구통계 왜곡에 의한 부분으로 나눴습니다. 후훈련은 쌍별 평균 품질 상관을 0.377, 편향 상관을 0.092 끌어올렸습니다. [사실] 직함·기술·전공·경력 같은 인적자본 변수가 설명하는 콜백 분산은 베이스 모델 9.3%에서 후훈련 모델 16.5%로 늘었습니다. [사실]
논문이 명시하지 않은 산수를 하나 해 보겠습니다. [추정] 품질 상관은 편향 상관보다 약 4배 더 올랐습니다. 새로 생긴 합의의 대부분은 같은 후보를 정당한 근거로 강하다·약하다 판단하는 데서 온다는 뜻이고, 이는 좋은 소식처럼 들리며 중간값 지원자에게는 실제로 그렇습니다. 하지만 품질에 대한 합의야말로 경계선의 지원자를 어디서나 동시에 밀어내는 힘입니다. 체계적 배제율은 5.6%에서 17.3%로, 약 3.1배 올랐습니다. [추정] 모델은 최고의 지원자를 고르는 데는 나아졌고, 커트라인 근처의 모든 사람에게는 나빠졌습니다.
누가 배제되는가
배제는 고르게 분포하지 않습니다. 후훈련 모델에서 교차 집단별 체계적 배제율은 12.2%에서 21.7% 사이였습니다. [사실] 40세 초과 집단의 평균 배제율은 20.1%, 40세 미만은 14.5%였습니다. [사실] 5.6%p 격차이고, 젊은 집단의 약 1.4배입니다. [추정] 저자들은 이 불평등이 "주로" 후훈련이 증폭한 연령 차별에서 온다고 봅니다.
비교 하나 더. 연령 페널티(-3.6%)는 인종·성별 이득(+1.1~1.5%)의 2~3배 크기입니다. [추정] 어떤 벤더가 후훈련 선별 모델이 인종·성별 "공정성을 개선했다"고 보고한다면, 이 논문은 2005년 이전 졸업자에게는 무슨 일이 있었는지 물어보라고 말합니다.
너무 많이 읽어내지 말아야 할 이유
이것은 프리프린트이고, 저자들이 밝힌 한계는 이 수치를 실제 채용 파이프라인에 적용하려는 누구에게나 중요합니다.
모델들은 오픈웨이트 중형입니다. GPT·Claude·Gemini급 프론티어 모델 — 대부분의 상용 선별 벤더가 실제로 라이선스하는 것 — 은 아무도 테스트하지 않았습니다. 같은 후훈련 역학이 그 규모에서도 성립하는지는 열린 질문입니다. 인구통계 변수는 이진이고, 이름은 인종과 혼입될 수 있는 사회경제적 연상을 실어 나르며, 프로필은 자유 서술 이력서가 아니라 구조화된 요약이고, 데이터는 미국 온라인 노동시장의 한 시점 스냅샷입니다. [사실] 저자들은 후훈련의 어느 단계 — 지도 미세조정, DPO, 강화학습 — 가 연령 이동을 만드는지도 말하지 못합니다. [사실]
합리적인 반론도 있습니다. 모델이 옳다면 모델 간 합의는 바로 원하던 것입니다. 정말 약한 프로필에 대한 17.3% 배제율은 스캔들이 아니라 선별입니다. 논문의 재반론은, 배제가 가장 빠르게 늘어난 집단이 기술이 아니라 졸업 연도로 정의되고, 공유된 훈련 레시피 때문에 그 오류가 분산으로 상쇄되지 않는다는 것입니다.
우리 쪽 한계도 적어 둡니다. 여기 인용한 콜백 수치는 논문의 집계값이고, 우리는 실험을 재현하지 않았으며, "3.6% 낮다"는 저자들이 서술한 그대로 옮겼습니다.
채용하는 쪽, 채용되는 쪽에 갖는 의미
선별 도구를 평가하는 HR팀과 인사 전문가에게 실무적 함의는 벤더 집중입니다. 우리 회사의 선별 벤더와 경쟁사의 선별 벤더가 비슷하게 후훈련된 모델 위에 세워져 있다면, 독립적인 필터를 하나 더한 것이 아니라 같은 필터를 다시 더한 것입니다. 저자들은 규제 당국 수준의 표준화된 편향 감사, 기업 단위의 정렬 데이터셋, 후훈련 데이터·방법의 의도적 다변화, 모델 간 음의 상관 샘플링을 권고합니다. [주장] 아직 어느 것도 표준 관행이 아닙니다.
인사 관리자와 노사관계 전문가에게 연령 결과는, 미국과 EU 차별금지법이 명시적으로 보호하지만 대부분의 AI 공정성 벤치마크가 건너뛰는 바로 그 특성에 떨어집니다.
40세 이상 지원자에게 조언은 불편하지만 구체적입니다. 이 연구의 모델들은 졸업 연도에서 나이를 추론했습니다. 졸업 연도 생략은 대부분의 이력서 양식에서 합법이고, 논문이 가장 해롭다고 찾아낸 신호를 제거합니다.
이 발견은 우리가 다룬 두 연구 옆에 놓입니다. 7만 명 지원자 현장실험은 AI 음성 면접이 채용 제안을 늘린다는 것을 보였습니다 — AI가 깔때기를 넓힐 수 있다는 증거입니다. 그리고 인재 확보 관리자 에버그린 분석은 이력서 선별이 이미 얼마나 자동화됐는지 추적합니다. 단일문화 편향은 그 둘 사이의 빠진 조각입니다. AI는 개별 채용 결정을 더 낫게 만들면서, 노동시장 전체는 덜 너그럽게 만들 수 있습니다.
출처
- Bone, M., Stephany, F., del Rio-Chanona, M. (2026). Monocultural Biases: Correlated biases in large language models lead to unequal systemic exclusion rates in hiring. arXiv:2609.22169, v1 2026년 8월 26일 제출. COLM 2026 채택. 프리프린트 — 저널 동료심사 전. https://arxiv.org/abs/2609.22169
AI 보조 분석. 이 글은 논문 초록과 HTML 전문을 바탕으로 AI 보조로 작성되고 게시 전 검토되었습니다. 수치는 [추정] 표기가 없는 한 저자들의 것이며, [추정]은 저자들이 보고한 수치에 대한 우리의 계산입니다.
본 분석은 Anthropic Economic Index, 미국 노동통계국(BLS), O*NET 직업 데이터를 기반으로 합니다. 방법론 자세히 보기
업데이트 이력
- 2026년 9월 23일에 최초 게시되었습니다.
- 최초 게시 이후 주요 업데이트가 없습니다.