생성형 AI와 비판적 사고: 생산성과 검토 노력 연구가 함께 말하는 것
회의 20분 전, AI가 시장 진입안의 목차와 결론을 완성했다. 첫 페이지에는 시장 규모와 경쟁사 비교까지 정리돼 있었다. 팀장이 숫자 하나를 가리키며 물었다.
“이 수치가 틀리면 결론도 바뀝니까?”
작성자는 바로 답하지 못했다. 숫자를 쓴 것은 AI였고, 그 숫자가 어떤 자료의 어떤 기준에서 나왔는지 확인하지 않았기 때문이다. 문서는 완성돼 있었지만 판단이 만들어진 경로는 비어 있었다.
이런 장면 앞에서는 “AI를 쓰면 사람이 덜 생각한다”는 결론으로 넘어가기 쉽다. 그런데 이 문장은 검증된 사실처럼 유통되는 것에 비해 근거가 얇다. 실제 연구들은 더 조심스럽고, 더 흥미로운 이야기를 한다.
지금까지의 연구로 말할 수 있는 것은 이 정도다. 생성형 AI가 특정 과제의 생산성을 높인다는 근거는 분명하다. 반면 장기적으로 인간의 사고능력이 떨어지는지는 이 글에서 검토한 연구만으로 판단할 수 없다. 대신 AI에 대한 신뢰와 과업의 구조가 사람이 검토 노력을 어디에 쓰는지를 바꿀 수 있다는 단서가 있다.
세 편의 연구를 차례로 보자. 각각 다른 질문에 답한다. 얼마나 빨라지는가, 얼마나 검토하는가, 그리고 반복하면 어떻게 되는가.
빨리 쓰는 능력과 옳게 판단하는 능력
Noy와 Zhang의 2023년 Science 연구는 대학 교육을 받은 전문직 종사자 453명에게 직종별 중간 난도의 글쓰기 과제를 수행하게 한 사전등록 무작위 실험이다. ChatGPT를 사용한 조건에서 평균 소요 시간은 약 40% 줄었고, 독립 평가자가 매긴 결과물의 품질은 약 18% 높아졌다.
생산성 이익은 뚜렷했다. 다만 실험 과제는 실제 업무 전체를 재현하지 않았다. 조직 내부에만 있는 정보, 정밀한 사실 확인, 결정 이후의 책임까지 요구하는 과제가 아니었다. 이 결과를 코딩이나 채용, 의료, 전략 판단 전반으로 옮겨 적을 수는 없다.
여기서 두 가지를 갈라놓아야 한다.
- 작성 생산성: 얼마나 빨리, 매끄럽게 결과물을 만드는가
- 판단 품질: 근거가 충분한지, 반례를 검토했는지, 결과에 책임질 수 있는가
AI는 앞의 비용을 크게 낮춘다. 뒤의 문제는 그대로 남는다. 오히려 순서가 뒤집히면서 더 까다로워지는 면이 있다. 예전에는 자료를 모으고 판단한 뒤 문장을 썼다면, 이제는 완성된 문장이 먼저 도착하고 그 문장을 지탱하는 전제를 거꾸로 찾아가야 한다. 이 역방향 작업은 원래 순서보다 힘들고, 그래서 자주 생략된다.
생성형 AI와 비판적 사고: 신뢰할수록 덜 검토하게 될까
Microsoft Research의 CHI 2025 동료심사 연구는 업무에서 생성형 AI를 주 1회 이상 쓴다고 답한 지식노동자 319명에게서 936개의 실제 사용 사례를 수집했다.
두 가지 방향이 함께 나타났다. 참가자들은 해당 과업에서 AI가 잘할 것이라고 믿을수록 비판적 사고를 덜 수행했다고 보고했다. 반대로 자신의 과업 수행 능력에 대한 자신감이 높을수록 더 많이 검토했다고 답했다. 질적 분석에서는 사고의 초점이 이동하는 모습도 관찰됐다. 정보 수집과 초안 작성에서 출력 검증, 응답 통합, 업무 감독 쪽으로 옮겨간 것이다.
이 결과를 “AI가 비판적 사고를 감소시켰다”는 인과 증명으로 읽으면 안 된다. 실제 인지능력을 측정한 장기 연구가 아니라 한 시점의 자기보고 조사다. 참가자가 자신의 사고 과정을 정확히 기억하고 보고했는지도 알 수 없다. 확인된 것은 과업별 AI 신뢰와 보고된 검토 노력 사이의 연관성이다.
그럼에도 실무적으로는 무시하기 어려운 단서다. 검토 노력의 배분을 결정하는 것이 AI의 실제 정확도가 아니라 사용자가 그 과업에서 AI를 얼마나 신뢰하는지일 수 있다는 뜻이기 때문이다. 신뢰와 정확도가 어긋나는 지점, 그러니까 AI가 잘할 것 같지만 실제로는 취약한 과업에서 검토가 가장 얇아진다.
틀린 답은 한 번으로 끝나지 않을 수 있다
Glickman과 Sharot의 Nature Human Behaviour 연구는 총 1,401명이 참여한 일련의 실험에서, 지각·감정·사회적 판단의 작은 편향이 인간과 AI의 반복적 상호작용을 거치며 증폭될 수 있음을 보였다. 사람이 편향된 시스템의 출력을 보고 판단하고, 그 판단이 다시 시스템의 입력이 되는 순환에서 편차가 커졌다. 참가자들은 AI가 자신의 판단에 끼친 영향도 과소평가했다.
이 연구의 범위는 좁게 읽어야 한다. 일반적인 대화형 LLM 업무를 시험한 것이 아니다. CNN(합성곱 신경망)과 실제 텍스트-이미지 시스템 등을 특정 판단 과제에서 사용했다. “유창한 챗봇 답변이 모든 인간 판단을 오염시킨다”로 확대할 수 없다.
그리고 이 연구에는 함께 읽어야 할 반대 결과가 있다. 정확한 AI와 상호작용한 조건에서는 사람의 판단이 오히려 개선됐다. 증폭된 것은 시스템 안에 편향이 있을 때였다. AI가 사고를 나쁘게 만드는 장치라는 이야기가 아니다. 정확한 신호든 편향된 신호든 더 강하게 되먹임하는 환경이라는 이야기다. 그렇다면 관건은 AI를 쓰느냐 마느냐가 아니라 무엇이 순환에 들어가는지가 된다.
인간은 원래 생각을 도구에 맡겨왔다
이 대목에서 계산기가 등장한다. 인지적 외주화가 문제라면 문자와 계산기도 진작 문제였어야 하지 않느냐는 반론이다.
이 반론은 생각보다 강하다. 인간은 기억을 글에, 계산을 도구에, 판단을 전문가에게 오래 맡겨왔다. 그때마다 잃은 능력도 분명히 있다. 서사시를 통째로 암송하는 능력, 암산으로 장부를 맞추는 능력, 별자리로 방향을 찾는 능력. 그런데 이 상실을 애도하는 사람은 거의 없다. 외주화는 문명이 작동해온 방식이고, 잃은 능력 대부분은 잃어도 괜찮은 것이었다.
그러니 “AI에 맡기면 능력이 준다”는 지적만으로는 부족하다. 계산기와 다른 점을 말할 수 있어야 한다.
한 가지는 범위다. 계산기는 계산 결과를 준다. 생성형 AI는 문제를 정의하고, 자료를 고르고, 반론을 정리하고, 결론의 문장까지 한 번에 내놓는다. 사용자는 중간 과정을 통과하지 않고 완성돼 보이는 답에 도착한다.
더 중요한 차이는 검증 가능성이다. 계산기가 뱉은 숫자는 다른 방법으로 확인할 수 있다. 어림셈을 해보거나, 다른 계산기를 쓰거나, 역연산을 하면 된다. 검증 비용이 원래 작업 비용보다 훨씬 싸다. 반면 AI가 만든 종합, 그러니까 “이 시장은 성숙기에 진입했다” 같은 판단은 그렇지 않다. 제대로 확인하려면 종합 자체를 다시 해야 한다. 검증 비용이 위임한 작업 비용과 거의 같아진다. 그래서 검증은 미뤄지고, 미뤄진 검증은 대체로 이뤄지지 않는다.
여기서 질문의 방향이 바뀐다.
무엇을 맡겼는가가 아니라, 맡긴 것을 되짚어 이의를 제기할 수 있는가.
이 기준으로 보면 대응책도 달라진다. AI 사용량을 줄이는 것은 초점이 어긋난 처방이다. 검증 비용이 감당 가능한 자리에 AI를 배치하는 것이 문제의 핵심에 가깝다.
AI의 자리를 네 칸으로 나누어보자
| AI의 역할 | 적합한 사용 | 사람이 남겨야 할 일 |
|---|---|---|
| 탐색자 | 자료 후보와 관점을 넓힌다 | 출처의 존재·시점·대표성을 확인한다 |
| 초안자 | 구조와 문장 후보를 만든다 | 목적과 주장, 핵심 근거를 소유한다 |
| 반론자 | 빠진 관점과 반례를 제시한다 | 어떤 반론이 결정적인지 판단한다 |
| 결정자 | 선택을 권고하거나 순위를 매긴다 | 고위험 결정에서는 그대로 넘기지 않는다 |
앞의 세 자리에는 공통점이 있다. AI의 출력이 재료로 들어오고, 사람이 그것으로 무언가를 만든다. 검증은 작업 과정에 섞여 있다. 네 번째 자리는 다르다. AI의 출력이 결과물 자체가 되고, 검증은 별도의 노동이 된다. 그래서 생략하기 쉽다.
다음 업무에서 AI를 열기 전에 한 줄만 적어보자.
“이번 과업에서 AI는 ______ 역할까지만 맡는다.”
회의 20분 전의 시장 진입안으로 돌아가 보자. AI에게 초안과 자료 후보를 맡긴 것은 문제가 아니다. 문제는 그다음이었다. 시장 규모 수치가 틀리면 결론이 바뀌는지, 원문은 무엇인지, 반대 사례는 없는지. 이 셋 중 하나도 확인하지 않았다면 AI는 초안자가 아니라 결정자 자리에 앉아 있었던 것이다. 문서에는 그 차이가 드러나지 않는다. 두 경우 모두 똑같이 완성된 문서로 보인다.
세 연구가 겹치는 지점도 여기다. 초안을 만드는 비용이 낮아지면서 사람이 해야 할 일은 작성에서 검증과 통합과 감독 쪽으로 넘어간다. 그 자리로 따라가지 않으면 사고의 총량은 줄어든다. 따라가면 줄지 않는다.
생성형 AI와 비판적 사고의 관계는 사용량보다 역할 배치에 달려 있다. AI가 생각을 빼앗는 것이 아니다. 우리가 AI에게 내준 자리가 남은 생각의 모양을 결정한다.
함께 읽기: 판단의 위임 범위를 먼저 설계하려면 AI 시대 인간의 역할과 위임 계약서를 함께 살펴볼 수 있다.
참고자료
- Noy, S. & Zhang, W. (2023), “Experimental evidence on the productivity effects of generative artificial intelligence”, Science. — 동료심사 무작위 실험
- Lee, H.-P. et al. (2025), “The Impact of Generative AI on Critical Thinking”, DOI 10.1145/3706598.3713778, CHI 2025. — 동료심사 자기보고 조사
- Glickman, M. & Sharot, T. (온라인 2024; 권호 2025), “How human–AI feedback loops alter human perceptual, emotional and social judgements”, Nature Human Behaviour 9. — 동료심사 실험 연구

