핵심 요약
첫째, 이 연구는 AI가 실제 일자리를 얼마나 줄였는지가 아니라, 대학생의 AI 사용을 설명하는 정보가 채용 판단을 어떻게 바꾸는지 살펴본다. 미국의 채용 경험이 있는 재직자 1,750명을 대상으로 한 설문 실험에서, 학생의 노력과 능력을 AI가 대신할 수 있다는 강한 프레이밍은 학업 자격에 대한 우려를 높였다. AI를 학습 보조 도구로 설명하면서 오용 가능성도 언급한 약한 프레이밍에서도 우려가 증가했지만, 강한 프레이밍의 효과가 더 컸다.
둘째, 강한 프레이밍에서는 높은 GPA가 주는 평가상의 이점이 약해지는 패턴이 나타났다. 다만 모든 지원자 집단의 면접 관심 감소가 통계적으로 유의한 것은 아니다. 약한 프레이밍이 지원자에게 확실한 프리미엄을 준다는 증거도 없다. 면접 응답보다 시작 연봉의 추가 인상에 대한 협상 의향에서 프레이밍 간 차이가 더 뚜렷했다. 이는 실제 면접 요청, 채용, 연봉 지급을 관찰한 결과가 아니라 가상 이력서에 대한 응답이다.
셋째, 두 프레이밍 집단은 모두 대면 시험을 자격에 대한 우려를 줄이는 정보로 평가했다. 그러나 대면 시험을 도입하면 실제 채용이나 임금이 회복되는지까지 검증한 것은 아니다. 이 연구는 졸업생 진입 문제를 업무 대체만이 아니라, 졸업장과 학점이 개인 역량을 얼마나 믿을 만하게 보여 주는가라는 관점에서 보게 한다. 2026년 10월 공개된 워킹페이퍼이며 아직 동료심사 학술지 게재 논문이 아니다.
배경 및 이론적 맥락
대학의 역할에는 역량 형성과 역량에 대한 신호 제공이 함께 있다. 인적자본 관점에서는 교육이 학생의 지식과 판단 능력을 높이는 것이 중요하다. 신호 이론에서는 성적이나 학위가 고용주에게 보이지 않는 능력과 노력을 전달하는 것이 중요하다. 두 기능은 관련되어 있지만 동일하지 않다. 학생이 실제로 학습해도 고용주가 그 성과를 믿지 않으면 신호가 약해질 수 있고, 좋은 성적을 얻어도 독립 수행 능력이 부족하면 자격과 역량이 어긋날 수 있다.
AI는 이 연결을 양방향으로 바꿀 수 있다. 설명, 피드백, 연습을 지원하면 학습을 보완하는 도구가 된다. 반면 과제 수행 자체를 대신하면 결과물과 학점이 학생 자신의 역량을 반영하는 정도가 낮아질 수 있다. 논문이 제시하는 문제는 고용주가 이 두 사용을 구별하기 어렵다는 것이다. 경력자는 직장에서의 성과나 경력 기록을 제시할 수 있지만, 신규 졸업생은 학위와 GPA에 더 의존할 수 있어 신호의 불확실성이 중요하다. 이는 연구의 이론적 설명이며, 이 실험에서 경력자와 신입의 실제 고용을 비교한 것은 아니다.
연구는 신호가 불확실해지면 고용주가 집단 수준의 믿음에 더 의존하여 인종·성별 차이가 커질 가능성도 검토한다. 그러나 그런 가설이 있다고 해서 차별 확대가 관찰된 것은 아니다. 이 연구에서는 지원자 인종·성별에 따른 일관된 처치 효과 차이를 찾지 못했고, 일부 집단의 결과는 산업 구성에 민감했다.
연구 방법론
조사는 2026년 5월 21일부터 6월 8일까지 Prolific을 통해 진행됐다. 미국 거주, 영리 부문 전일제 재직, 현 직장 근속 1년 이상, 채용 의사결정 책임을 가진 사람을 모집했다. 완료 응답자는 1,750명이다. 표본은 전국 고용주를 확률 추출한 대표 표본이 아니라 플랫폼에서 자발적으로 참여한 재직자 집단이다. 표본의 92.2%는 직장에서 어떤 형태로든 AI를 사용한다고 응답했다.
응답자는 대조군, 약한 AI 프레이밍 집단, 강한 AI 프레이밍 집단에 무작위 배정됐다. 대조군은 이력서 평가 안내만 받았다. 약한 프레이밍은 AI가 학습을 도울 수 있지만 부정한 사용도 있으며 대학의 대응 방법이 명확하지 않다는 설명을 제시했다. 강한 프레이밍은 AI 에이전트가 학생의 과제와 시험 등 학업 활동을 대신할 수 있고 대학이 이를 탐지하기 어렵다는 설명을 제시했다. 강한 프레이밍에 담긴 능력에 관한 서술은 실험 자극의 내용이지, 본 리뷰가 모든 대학 과제를 AI가 해결한다고 검증한 사실이 아니다. 두 문구는 보완 대 대체만이 아니라 언론·성적 인플레이션·탐지 문제 등 여러 요소에서 달라, 효과를 어느 한 문장이나 요소에 귀속할 수 없다.
각 응답자는 GPA가 3.8/4.0인 이력서와 2.7/4.0인 이력서를 하나씩 보았다. 순서는 무작위였다. 이름으로 백인·흑인, 남성·여성을 시사하도록 무작위 배정했고, 경력·기술·동아리·봉사 경험은 유사하게 구성했다. 학교와 전공은 가렸다. 응답자는 자신이 통상 채용하는 학교와 전공을 가정하라는 안내를 받았다. 이 때문에 산업 간 모집은 가능했지만 응답자마다 상상한 자격이 다를 수 있다. 실제 지원자의 AI 사용 이력을 공개한 실험도, 실제 공고에 이력서를 보낸 현장 감사 실험도 아니다.
결과는 면접 초청 의향의 7점 척도와 최초 제시 연봉보다 얼마나 더 지급할 의향이 있는지에 대한 응답으로 측정했다. 주요 모형은 응답자 고정효과, 프레이밍·GPA·인종·성별의 상호작용, 이력서 제시 순서를 사용하고 표준오차를 응답자 수준에서 군집화했다. 동일 응답자의 두 평가를 이용하므로 프레이밍의 주효과는 고정효과에 흡수된다. 따라서 GPA에 따른 상대 평가와 프레이밍별 차이를 특히 주의해서 읽어야 한다. 주요 검정에는 Romano-Wolf 다중검정 보정을 적용했지만, 세부 집단 분석의 검정력과 우연한 유의성 문제는 남는다.
연구 결과
첫째, 두 프레이밍은 학업 자격의 신뢰에 대한 우려를 높였다. Table 3의 조정 평균은 대조군 4.126, 약한 프레이밍 4.374, 강한 프레이밍 4.570이다. 대조군 대비 변화는 각각 0.248점과 0.444점이며 모두 유의했다. 두 처치 사이 차이 0.196점도 유의했다(p=.025). 이는 해당 정보가 응답자의 판단을 바꿀 수 있다는 증거이지, 모든 고용주가 이미 졸업장을 불신한다는 증거가 아니다. 이 표의 관측 수는 1,754로, 본문의 완료 응답자 1,750명과 다르다. 표본 수가 모든 분석에서 같다고 보아서는 안 된다.
둘째, 높은 GPA의 면접 평가상 이점이 강한 프레이밍에서 작아지는 패턴이 나타났다. 예를 들어 백인 남성의 높은 GPA 이력서에 대한 예측 면접 점수는 대조군 5.22, 약한 프레이밍 5.22, 강한 프레이밍 4.80이다. 고정효과 모형의 기준인 낮은 GPA 백인 남성의 점수는 4.18로 고정되어, 높은 GPA와의 격차는 대조군 1.04점에서 강한 프레이밍 0.62점으로 줄었다. 이 수치는 GPA 프리미엄 축소의 예이며, 실제 면접 확률이 40% 하락했다는 뜻이 아니다. 본문은 주요 인종·성별 집단의 강한 프레이밍 면접 감소가 95% 수준에서 유의하지 않은 경우를 명시한다. 낮은 GPA 집단의 면접 의향에서는 처치 효과에 대한 증거가 더 약했다.
셋째, 연봉의 추가 인상에 관한 협상 의향에서 더 뚜렷한 차이가 나타났다. 높은 GPA 백인 남성의 추가 인상 의향은 대조군 1.97%, 약한 프레이밍 2.28%, 강한 프레이밍 1.76%였다. 흑인 남성은 각각 2.16%, 2.27%, 1.72%, 흑인 여성은 2.18%, 2.51%, 1.78%였다. 약한 프레이밍과 강한 프레이밍을 비교하면 높은 GPA 백인 남성은 0.52%p, 흑인 남성은 0.55%p, 흑인 여성은 0.73%p 낮아졌고, 논문은 이 세 집단의 차이가 유의하다고 설명한다. 높은 GPA 백인 여성은 2.15%에서 1.87%로 낮아졌지만 두 처치 간 차이는 유의하지 않았다. 이 숫자는 최초 제시 연봉 위에 더 줄 의향이지 전체 연봉 감소율이나 실제 협상 타결액이 아니다. 약한 프레이밍과 대조군의 차이가 유의하지 않은 경우가 많으므로, AI 보조 사용을 설명하면 연봉이 오른다는 결론도 성립하지 않는다.
넷째, 인종·성별이나 산업에 관한 세부 결과는 신중히 읽어야 한다. 높은 GPA 백인 여성에서 강한 프레이밍의 불이익이 작았던 패턴은 소매업 및 정보기술·소프트웨어 산업 응답자에 민감했다. 그 산업을 제외하면 다른 높은 GPA 집단과 비슷한 음의 패턴이 나타났다. 이를 특정 집단은 AI 우려로부터 보호된다는 법칙으로 해석할 수 없다. AI 노출이 높은 산업이 반드시 가장 크게 반응한 것도 아니며, 중간 노출 산업에서 뚜렷한 패턴이 관찰됐다.
다섯째, 우려를 줄일 정보에 관한 질문에서 두 처치 집단은 대면 시험을 대조군보다 더 안심이 되는 정보로 평가했다. 약한 프레이밍에서는 프로젝트·인턴십 등 다른 정보도 더 긍정적으로 평가하는 경향이 있었지만, 강한 프레이밍에서는 이런 정보에 대한 낙관이 줄었다. 온라인 마이크로 자격보다 대면 마이크로 자격이 더 안심이 된다는 응답도 관찰됐다. 이는 제시된 정보의 설득력에 대한 평가이며, 대면 시험의 학습 효과나 예측 타당도, 온라인 교육의 실제 품질을 측정한 결과가 아니다.
결론 및 의의
첫째, 이 연구가 더하는 관점은 AI 시대의 신규 졸업생 문제가 생산성이나 일자리 수요만의 문제가 아니라 자격의 신뢰 문제이기도 하다는 것이다. 학생이 높은 성적을 받더라도 고용주가 그 성적을 누구의 수행으로 이해하는지에 따라 평가가 달라질 수 있다. 실험은 이 믿음의 변화 가능성과 높은 GPA 프리미엄 축소에 부합하는 패턴을 보여 준다. 그러나 실제 대학생의 능력 하락, 실제 졸업장의 가치 하락, 전국적인 신규 채용 감소를 직접 확인하지 않았다. ’신호가 약해질 수 있다’와 ’대학 교육의 가치가 이미 사라졌다’는 전혀 다른 주장이다.
둘째, AI 사용을 보조라고 부르기만 하면 문제가 해결되는 것은 아니다. 약한 프레이밍에도 오용과 대학 대응의 불확실성이 포함됐으며, 학업 자격에 대한 우려는 증가했다. 확실한 면접·연봉 프리미엄도 나타나지 않았다. 따라서 대학의 홍보 문구를 바꾸거나 학생에게 AI 사용을 긍정적으로 포장하게 하는 것보다, 도구를 사용한 성과와 학생이 직접 할 수 있는 수행을 구분해 제시하는 방식이 중요하다는 교육적 가설이 나온다. 이 연구는 그런 제도를 시행한 실험이 아니므로 제도 효과는 별도의 검증 대상이다.
셋째, 교육과정에서는 AI 활용 능력과 독립 수행 능력을 서로 대체할 지표가 아니라 함께 확인할 대상으로 설계할 수 있다. 예를 들어 자료 분석 과제에서 AI가 제안한 코드를 사용한 결과물을 평가하되, 학생이 변수 선택 이유, 오류 점검, 결과 해석을 도구 없이 설명하도록 할 수 있다. 글쓰기에서는 AI 보조 초안과 별개로 주장·근거의 연결을 구두로 방어하거나, 새로운 반례에 대응하는 짧은 수행을 평가할 수 있다. 이는 논문 결과에서 도출한 적용 제안이며, 이 설계가 채용 평가를 높인다는 실험 결과는 없다. 핵심은 AI 사용 자체를 숨기는 것이 아니라 학생이 책임지는 판단의 범위를 드러내는 데 있다.
넷째, 대면 검증을 ’모든 평가를 대면 시험으로 돌려야 한다’는 처방으로 확대해서는 안 된다. 응답자가 대면 시험을 신뢰한다는 것과 그 시험이 직무 역량을 정확하고 공정하게 측정한다는 것은 다르다. 제한시간 시험은 깊은 탐구나 협업 능력을 충분히 측정하지 못할 수 있고, 장애·언어·이동 조건에 따른 장벽도 고려해야 한다. 교육기관과 기업은 직무 관련성이 높은 짧은 실습, 구두 설명, 현장 과제, 적절한 편의 제공 등을 함께 검토할 수 있다. 이런 접근의 타당성과 형평성은 이 논문에서 검증되지 않았다. 온라인 프로그램을 일괄적으로 낮게 평가하거나 마이크로 자격을 무용하다고 결론 내리는 것도 근거를 넘어선다.
다섯째, 졸업생의 노동시장 진입 지원은 학점·자격증을 더 쌓으라는 조언에서, 역량의 출처와 검증 가능성을 보여 주는 지원으로 넓어질 수 있다. 취업 상담에서는 결과물, 학생의 기여, AI의 도움, 검증 과정, 독립 수행 사례를 구분해 설명하도록 훈련할 수 있다. 포트폴리오에 도구 사용 기록을 많이 붙이는 것만으로 충분한 것은 아니다. 기록은 진짜 판단 능력을 보여 주는 증거와 연결되어야 한다. 연구는 이력서에 AI 역량을 써 넣거나 AI 사용 내역을 공개하는 처치를 하지 않았으므로, 그러한 공개가 면접에 유리하다고 권할 근거는 없다. 지원자는 해당 기업의 실제 과제·공개 요구를 따라야 하며, 연구의 가상 프레이밍을 자신의 채용 전략으로 곧바로 옮겨서는 안 된다.
여섯째, 기업의 대응도 고성적 지원자를 일괄적으로 의심하는 방향보다 신호의 해석을 정교하게 하는 방향이 바람직하다는 규범적 함의가 있다. 성적을 무시하는 대신 실제 직무와 관련된 수행 증거를 보완하고, 허용 도구와 평가 기준을 일관되게 안내하는 방식이다. 낮은 GPA 지원자의 평가가 덜 변했다고 해서 그들에게 유리한 결과가 나온 것은 아니다. 기본 평가에서는 높은 GPA 지원자가 더 긍정적이었다. 또 인종·성별별 차이가 일관되지 않았다는 결과는 차별이 없다는 증명이 아니다. 세부 표본이 작고 가상 판단의 이해관계가 낮아 실제 차별을 포착하지 못했을 수 있다. 검증 기회가 자원 있는 학교와 학생에게만 제공되지 않도록 설계를 점검할 필요가 있다.
일곱째, 해석의 가장 큰 경계는 믿음에 관한 단기 실험과 노동시장의 장기 변화 사이에 있다. 처치 문구는 고용주의 판단에 영향을 주도록 구성됐으며, 현실의 정보 노출은 더 다양하다. 대조군도 사전에 AI 관련 질문을 받았다. 고정효과 모형에서는 프레이밍의 공통 주효과가 직접 식별되지 않으므로 모든 지원자에게 동일하게 발생하는 평가 변화까지 읽어낼 수 없다. 학교·전공을 가렸고 민간 재직자 플랫폼 표본을 사용했다는 조건도 중요하다. 특히 초록의 ’명확한 감소’라는 요약보다 본문과 표의 비교 집단·유의성을 우선해야 한다. 면접 점수 감소와 실제 면접 확률 감소를, 추가 인상 의향과 실제 연봉 감소를 혼동하지 않는 것이 이 연구를 교육 정책에 사용하는 최소 조건이다.
여덟째, 후속 연구에서는 고용주가 실제로 받는 이력서와 직무 과제를 이용해 독립 수행 증거의 효과를 검증할 필요가 있다. 동일한 능력의 지원자에게 AI 보조 결과물, 구두 방어, 검증된 실습 기록을 달리 제시하고 실제 면접 요청·제안 연봉·채용 이후 성과를 추적하면 신호 보완의 효용을 더 직접적으로 알 수 있다. 프레이밍의 여러 요소를 분리하는 실험과 신념 변화의 지속성 추적도 필요하다. 대학별 평가 방식, 전공, 산업, 한국의 채용 관행이 다른 환경에서 재현되는지도 확인해야 한다. 이 연구의 가장 유용한 질문은 ’AI를 사용했는가’를 넘어 ’사용한 뒤에도 무엇을 스스로 알고, 수행하고, 설명할 수 있는가를 누가 어떻게 보증하는가’이다.
참고문헌
Boyd-Swan, C., & Reynolds, C. L. (2026). Early evidence on employer responses to college student use of generative AI (EdWorkingPaper No. 26-1604). Annenberg Institute at Brown University. https://doi.org/10.26300/13ds-ed72
현재 공개 PDF는 2026년 10월 2일자로 작성된 워킹페이퍼이다. 공식 연구 페이지와 DOI에서 제목·저자·번호를 확인했다. 동료심사 게재 결과로 해석하지 않는다.
AI 활용 내역
이 글은 AI(Instinct AI 어시스턴트)를 활용하여 논문의 핵심 내용을 분석·요약하고, 한국어 리뷰 원고를 작성하였습니다. 최종 검토 및 발행은 블로그 운영자가 수행합니다.
댓글 남기기