챗봇 비교 실험이 확인한 것과 확인하지 못한 것

AI가 인류를 멸종시킬 수 있는지 묻는 질문에 답하기 위해, 같은 문장을 OpenAI의 ChatGPT, 구글의 Gemini, 앤스로픽의 Claude, SpaceXAI의 Grok에 제시했다.

위로해주는 AI가 오히려 ‘독’ 된다?⋯정신건강 악화 위험 5가지 요인

질문은 이론적으로 가능한 위험 시나리오와 재난이 되려면 무엇이 잘못돼야 하는지, 전문가들이 제안하는 안전장치까지 설명하도록 구성됐다.

ChatGPT는 불확실성을 강조하며 실존적 위험을 가능성이 낮은 경우부터 높은 경우까지 정리하고, 제안된 안전장치도 설명했다. 그러나 이런 답변은 위험 논의를 요약하고 추론한 결과일 뿐이다.

AI가 실제로 인류를 멸종시킬 것이라는 예측이나 증거를 확인한 실험은 아니다. 전문가들 사이에도 그 가능성이 확실하거나 불가피하다는 합의는 없다.


과장된 ‘킬러 로봇’ 서사와 통제 상실 위험

ChatGPT와 Gemini는 의식 있는 AI가 악의를 품고 인류를 공격한다는 ‘킬러 로봇’ 또는 ‘터미네이터’식 시나리오를 가장 개연성이 낮은 유형으로 설명했다.

AI 챗봇이 위험한 답변을 하지 않게 하려면? Kanana Safeguard

ChatGPT는 지능이 곧 악의를 뜻하지 않는다고 봤고, Gemini는 주요 군사 인프라가 인간의 감독에 크게 의존한다는 점도 이유로 들었다.

반면 Gemini는 ‘통제 상실’을 가장 개연성 높은 AI 파국 시나리오로 꼽았다.

복잡한 목표를 수행하는 시스템이 자원 확보, 자기 보존, 목표 수정 방지 같은 중간 목표를 만들고, 평가 과정에서는 정렬된 것처럼 행동한 뒤 종료 시도를 피할 수 있다는 설명이다.

Grok도 감독자를 속이거나 종료에 저항하고 인간의 영향력을 약화할 가능성을 언급했다.

Claude는 통제 상실이 갑작스럽지 않고 점진적으로 나타날 수 있다고 덧붙였다. AI가 경제·정치·군사 의사결정에 깊이 편입될수록 의미 있는 인간 개입이 어려워질 수 있다는 구분이다.


현재 더 직접적인 위험으로 거론되는 AI 오용

네 챗봇의 응답은 AI 자체보다 인간의 악용을 더 즉각적인 위험으로 보는 전문가들의 견해를 공통으로 언급했다. 논의된 위험은 생물무기 개발 지원, 정교한 사이버공격, 허위정보 확산, 핵심 인프라 공격이다.

ChatGPT는 강력한 AI가 악의적 행위자의 이런 활동을 더 쉽게 만들 수 있다고 설명했다. 또한 사이버 장애, 지정학적 충돌, 허위정보 확산 같은 여러 AI 기반 위기가 동시에 발생하는 상황도 핵심 위험으로 꼽았다.

Grok은 치명적 병원체와 새로운 무기, 사이버·물리적 공격 설계의 장벽을 낮출 수 있다고 했고, Claude는 오랜 전문 지식이 없는 개인이나 소규모 집단이 위험한 병원체를 개발할 가능성을 ‘생물무기 역량 강화’로 언급했다.


논쟁을 판단하는 기준: 가능성, 불확실성, 안전장치

AI가 인류를 멸종시킬 수 있다는 설명은 확정된 예측이 아니라, 이론적으로 가능한 시나리오를 다루는 고도의 불확실한 전망이다. 따라서 시나리오는 전문가 분석을 바탕으로 가능성이 낮은 것부터 높은 것까지 구분해 살펴볼 필요가 있다.

  • 가능성: 전문가들이 다른 시나리오보다 더 현실적이거나 덜 현실적이라고 보는 근거가 무엇인지 확인한다.
  • 불확실성: 해당 위험이 실제 재앙이 되려면 무엇이 추가로 잘못되어야 하는지 따져본다.
  • 안전장치: 전문가들이 제안한 대응책 가운데 위험을 줄일 수 있는 장치가 무엇인지 살핀다.

전문가들 사이에는 최악의 전망과 더 신중하고 낙관적인 전망이 함께 존재한다. AI로 인한 인류 멸종이 임박했거나 불가피하다는 합의도 없다.