Generative AI without guardrails can harm learning: Evidence from high school mathematics

핵심 요약
첫째, 터키의 한 고등학교에서 약 1,000명의 수학 학생을 대상으로 한 RCT에서, ChatGPT와 유사한 표준 인터페이스(GPT Base)로 연습한 학생들은 연습 성적이 48% 향상되었지만, AI 없이 치른 시험에서는 통제 집단보다 17% 낮은 성적을 받았다.
둘째, 교사 설계 힌트를 제공하고 답을 직접 주지 않는 가드레일(GPT Tutor)을 적용하자, 연습 성적은 127% 향상되면서 시험 성적 하락이 거의 완전히 상쇄되었다.
셋째, GPT Base 학생의 67%가 “답이 뭐야?”라고 물었고, GPT Base의 정답률은 51%에 불과했다.
넷째, 학생들은 자신의 학습 감소를 인지하지 못했다.

배경 및 이론적 맥락
생성형 AI가 생산성을 향상시킨다는 연구는 많지만, 학습에 어떤 영향을 미치는지는 불분명했다. 기술이 과제를 자동화하면 인간은 가치 있는 경험을 놓칠 수 있다. 자동항법장치에 대한 과도한 의존은 FAA가 조종사들에게 사용 최소화를 권고하게 만들었다. ChatGPT는 환각을 일으키므로, 사용자가 출력을 검증할 능력을 유지해야 한다.

연구 방법론
터키 대형 고등학교, 2023년 가을 학기 RCT. 9~11학년 약 50개 학급, 약 1,000명. 4회 90분 세션: (1) 교사 복습, (2) AI 보조 연습, (3) AI 없는 시험. 학급 단위 무작위 배정. 독립 채점자. Penn IRB 승인, 사전등록.

연구 결과
AI 보조 연습: GPT Base +48%, GPT Tutor +127%.
AI 없는 시험: GPT Base -17%, GPT Tutor -0.4%(통계적 차이 없음).
메커니즘: GPT Base 학생 67%가 “답이 뭐야?” 질문. 정답률 51%. 논리 오류가 연습에는 영향을 미쳤지만 시험에는 미치지 않음 = 학생들이 답을 단순 복사했음을 의미.
학생 인식 괴리: GPT Base 학생들은 실제로 더 못했지만 더 잘했다고 느꼈다.

결론 및 의미

첫째, Stromberg et al.(2026)의 26,811명 연구와 정확히 같은 패턴이 PNAS 수준의 RCT에서도 재현된다. 숙제/연습 점수는 오르지만 실제 시험 성적은 하락한다. AI가 생산성과 학습을 분리시킨다는 것은 이제 다수의 독립적 연구가 확인한 견고한 실증적 결론이다.

둘째, 이 연구의 가장 중요한 공헌은 해결책도 함께 제시한다는 점이다. “답을 주지 말고 힌트를 줘라”는 간단한 프롬프트 설계만으로 학습 손실이 거의 완전히 사라졌다. 교육자에게 즉시 적용 가능한 행동 지침이다. AI 사용을 금지할 필요 없다. 대신 AI가 답을 주지 않고 사고 과정을 안내하도록 설계하면 된다. Zhu et al.(2026)의 자율적 인지 외주화와 정확히 같은 원리다.

셋째, 학생들이 자신의 학습 감소를 인지하지 못한다는 발견은 정책적으로 가장 위험하다. 학생 자율에 맡기면 80%가 AI를 목발로 쓴다(Stromberg). 그리고 그들은 자신이 덜 배우고 있다는 사실조차 모른다(Bastani). MIT 보고서가 말하는 인지적 항복이 이것이다. 따라서 교육기관이 AI 사용 환경을 설계해야 하며, 학생의 자율적 판단에만 의존해서는 안 된다.

넷째, 부모와 교육자를 위한 즉시 행동 지침: 자녀가 AI로 숙제할 때 확인해야 할 것은 점수가 아니라 시간이다. 숙제 점수가 올랐으니 AI가 잘 도와주고 있다고 안심하는 순간, 실제로는 학습이 사라지고 있을 수 있다. “너 AI로 숙제할 때 몇 분이나 걸렸니?”가 “몇 점 받았니?”보다 훨씬 더 중요한 질문이다.

Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakci, O., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS, 122(26), e2422633122. https://doi.org/10.1073/pnas.2422633122

<AI 활용 내역> Claude. (2026), Claude, [대형언어모델(LLM)]. https://claude.ai/ 논문의 핵심 내용을 요약하고 한국어 리뷰를 작성하는 데 활용했으며, 결과물은 연구자가 최종 검토 후 수정해 블로그에 반영했다.


댓글

댓글 남기기