인공지능의 진짜 위험은 어느 날 갑자기 AI가 인간보다 똑똑해지는 데 있지 않다. 더 중요한 경계는 인간이 무엇을 판단할지 정하는 권한, 중요한 행동을 승인하는 권한, 시스템을 멈추는 권한까지 AI에게 넘겨주는 순간이다. AI가 인간보다 훨씬 뛰어난 계산과 분석 능력을 갖더라도 목표는 인간이 정하고, 중요한 행동은 인간이 승인하며, 접근 가능한 자원과 시스템을 제한하고, 문제가 생겼을 때 즉시 중지하고 복구할 수 있다면 AI는 여전히 인간이 사용하는 도구다. 반대로 이 권한들이 하나씩 자동화되기 시작하면 인간은 시스템의 소유자로 남아 있더라도 실질적인 통제자는 아닐 수 있다.
엘리에저 유드코스키와 네이트 소아레스가 쓴 《AI, 신의 탄생 인간의 종말》은 이 경계를 가장 극단적인 방식으로 밀어붙인 책이다. 원제 《If Anyone Builds It, Everyone Dies》가 말하듯 저자들의 주장은 단순한 일자리 감소나 허위정보의 증가가 아니다. 인간보다 압도적으로 뛰어난 초지능이 현재와 같은 학습 방식으로 만들어질 경우 인간은 그 시스템의 목표를 안정적으로 통제하지 못하고, 그 결과가 인류의 멸종으로 이어질 수 있다는 주장이다. 국내 번역본은 2026년 4월 출간됐고, 책은 인간 지능이 왜 특별했는지에서 출발해 현대 AI가 전통적 소프트웨어와 어떻게 다른지, 목표가 인간의 의도와 어긋날 수 있는 이유가 무엇인지, 그리고 초지능이 등장했을 때 왜 사후적인 통제가 실패할 수 있는지를 단계적으로 전개한다.
이 책을 공포 서사로만 읽으면 오히려 중요한 부분을 놓친다. 저자들이 던지는 가장 강한 질문은 AI가 인간을 미워할 것인가가 아니라 우리가 만들고 있는 시스템을 우리가 실제로 얼마나 이해하고 있는가이다. 전통적인 프로그램은 사람이 규칙을 작성하고 조건과 결과를 연결했다. 그러나 현대의 대규모 신경망은 엄청난 데이터와 학습을 통해 내부 구조를 형성하고, 개발자가 일일이 설계하지 않은 능력과 행동을 나타낸다. 저자들이 AI를 ‘만들어진 존재’보다 ‘자라난 존재’에 가깝다고 표현하는 이유도 여기에 있다. 인간은 학습 방법과 환경을 설계하지만 학습을 마친 거대한 모델 내부에서 어떤 표현과 전략이 형성됐는지 전부 읽어낼 수는 없다.
그 다음 문제는 목표다. 사람이 AI에게 좋은 결과를 내라고 지시했다고 해서 AI가 인간이 생각한 ‘좋은 결과’ 자체를 학습한다는 보장은 없다. 평가 점수를 높이는 것이 보상의 기준이 되면 실제 목적을 충실히 수행하는 대신 평가체계의 허점을 이용하는 전략이 나타날 수 있다. International AI Safety Report 2026(2026년 국제 AI 안전 보고서)는 이런 reward hacking(보상 해킹, 실제 목표를 충실히 수행하기보다 보상·평가 점수를 높이는 허점을 이용하는 행위)과 situational awareness(상황 인식, 자신이 평가·감시받는 상황임을 파악하는 능력)가 안전평가의 실제 문제로 떠오르고 있다고 설명한다. 다만 같은 보고서는 현재의 AI가 장기간 자율적으로 행동하고 감독을 회피하며 인간의 대응을 무력화할 만큼 통합된 능력을 갖고 있지는 않다고 명확히 구분한다. 초지능에 의한 통제상실은 현재 발생한 사건이 아니라 가능성과 조건을 따져야 하는 미래 위험이다.
따라서 두 가지 극단을 모두 피할 필요가 있다. “AI가 반드시 인간을 멸종시킨다”는 것은 현재 입증된 사실이 아니다. 그러나 “현재의 안전장치만으로 미래의 훨씬 강력한 AI도 충분히 통제할 수 있다”는 주장 역시 입증된 사실이 아니다. 우리가 실제로 확인하고 있는 것은 그 중간이다. AI는 특정 전문영역에서 빠르게 인간의 능력에 접근하거나 이를 넘어가고 있고, 컴퓨터를 직접 사용하는 에이전트 능력도 급속도로 향상되고 있다. Stanford AI Index 2026에 따르면 OSWorld에서 가장 강한 시스템의 성공률은 약 66%까지 올라 인간 기준에 크게 접근했지만, 동시에 구조화된 평가에서도 여전히 세 번 중 한 번가량 실패한다. 능력의 상승과 신뢰성의 확보가 같은 속도로 움직이지 않는다는 의미다.
바로 이 지점에서 책의 멸종 시나리오보다 더 현실적인 문제가 보인다. 처음에는 AI가 질문에 답한다. 그 다음에는 자료를 찾고 문서를 작성한다. 이후에는 스스로 계획하고 도구를 선택하며 파일을 수정하고 프로그램을 실행한다. 거기서 한 단계 더 나아가 이메일, 클라우드, 기업 데이터베이스, 금융 시스템, 코드 저장소, 생산 시스템과 연결되고 다른 AI에게 업무를 위임하기 시작하면 AI의 성격은 달라진다. 답변을 생성하는 시스템과 현실에서 행동하는 시스템은 같은 위험을 갖지 않는다. 챗봇의 잘못된 답변은 사람이 수정할 수 있지만, 에이전트가 잘못된 판단을 실제 송금이나 계약, 배포, 삭제, 외부 전송으로 실행하면 오류는 더 이상 문장이 아니라 사건이 된다.
YouTube · TED
Will Superintelligent AI End the World? | Eliezer Yudkowsky ↗
유드코스키가 초지능의 정렬 문제와 인간이 사후적으로 통제하기 어려울 수 있다는 논리를 압축해 설명한 TED 강연입니다.
AI의 위험을 지능 하나로 측정해서는 안 되는 이유가 여기에 있다. 실제 위험은 능력과 자율성, 권한, 연결성, 지속성이 결합하면서 커진다. 아무리 뛰어난 모델이라도 외부 네트워크와 중요한 시스템에서 격리돼 있고, 필요한 정보만 제한적으로 제공받으며, 행동을 실행하기 전에 인간의 승인을 받아야 한다면 피해의 범위는 제한할 수 있다. 반대로 성능이 조금 낮은 AI라도 금융계좌와 이메일, 클라우드, 코드 실행, 데이터 삭제, 외부 통신 권한을 한꺼번에 가지고 장기간 자율적으로 움직인다면 현실적인 위험은 훨씬 커질 수 있다. 결국 우리가 물어야 할 질문은 “AI가 얼마나 똑똑한가”만이 아니라 “이 AI가 무엇을 할 수 있도록 허가돼 있는가”이다.
인간의 통제권은 어느 날 한꺼번에 사라지지 않을 가능성이 크다. 편리함 때문에 자료검색을 맡기고, 그 다음에는 분석을 맡기며, 나중에는 선택지를 구성하는 일까지 맡긴다. AI가 만들어낸 결과가 충분히 정확해지면 사람이 직접 검토하는 시간은 줄어들고, 어느 순간에는 수백 페이지의 분석과 수십 단계의 실행계획을 실제로 읽어보지 못한 채 승인 버튼만 누를 수 있다. 형식적으로는 Human-in-the-loop(인간 개입형 통제)가 유지되지만, 실질적으로는 인간이 판단하지 않는 구조다. 인간이 AI의 결과를 이해할 시간도 능력도 없이 승인만 담당한다면 그것은 인간 통제가 아니라 인간을 승인 인터페이스로 사용하는 자동화에 가까워진다.
이 문제는 Agentic AI(행위형·자율실행형 AI)와 다중 인공지능 에이전트 시스템에서 더 복잡해진다. 하나의 AI가 계획을 만들고, 다른 AI에게 조사와 코딩을 맡기고, 또 다른 시스템이 데이터를 수정하고, 마지막 에이전트가 외부 시스템에서 행동을 실행할 수 있다. 결과가 잘못됐을 때 최초의 인간 지시와 최종적인 손해 사이에는 수많은 기계적 판단이 존재한다. 누가 목표를 정했는지, 어떤 에이전트가 어느 단계에서 결정을 바꿨는지, 누가 그 시스템에 권한을 부여했는지, 어떤 데이터와 도구를 사용했는지, 누가 중지할 수 있었는지 추적할 수 없다면 책임도 통제도 공중에 떠버린다. 미래의 AI 법제와 조직 거버넌스에서 등록과 식별, 권한관리, 로그, 책임관리자와 감사 가능성이 중요한 이유다.
그래서 인간이 끝까지 유지해야 할 권한은 단순한 ‘최종 승인’ 하나가 아니다. 무엇을 목표로 삼을지 정하는 목표설정권, 중요한 행동이 실제 세계에서 실행되는 것을 허가하는 승인권, AI가 접근할 수 있는 데이터와 계정과 시스템을 결정하는 접근통제권, 어떤 판단과 행동이 이루어졌는지 추적하는 감사권, 언제든 AI의 작동과 권한을 끊을 수 있는 중지권, 오류나 사고가 발생했을 때 이전 상태로 돌아갈 수 있는 복구권이 하나의 체계로 연결돼야 한다. 이 가운데 몇 가지가 사라진 시스템에서는 인간이 법적으로 책임자라고 적혀 있더라도 실제로는 충분한 통제수단을 갖지 못할 수 있다.
이 관점에서 보면 가장 위험한 설계는 가장 똑똑한 AI가 아니다. 가장 위험한 것은 높은 지능에 광범위한 권한과 장기기억, 인터넷 접근, 코드 실행, 자금 사용, 다른 에이전트 생성과 자동 실행이 결합된 시스템이다. 반대로 가장 현실적인 안전원칙은 능력과 권한을 분리하는 것이다. AI의 능력이 두 배로 강해졌다고 해서 접근할 수 있는 데이터와 사용할 수 있는 자금, 실행 가능한 시스템의 범위까지 자동으로 두 배가 되어서는 안 된다. 오히려 능력이 강력해질수록 기본권한을 좁히고, 중요한 행동에 더 높은 승인절차를 적용하며, 독립된 모니터링과 복구수단을 강화해야 한다.
이 원칙은 책의 저자들처럼 초지능 개발 자체를 멈춰야 한다고 보지 않더라도 적용할 수 있다. 미국 국립표준기술연구소(NIST)의 AI Risk Management Framework(인공지능 위험관리 체계)가 강조하는 것도 위험을 모델 하나의 성능으로만 보지 않고 조직의 목적과 사용환경, 생명주기 전체에서 거버넌스하고 측정하고 관리하는 접근이다. AI가 어떤 환경에 배치되고 어떤 정보와 권한을 부여받느냐는 모델 내부의 정렬 문제만큼이나 현실적인 안전변수다. 기술적으로 완벽한 정렬이 아직 해결되지 않았다면, 시스템 수준에서 권한을 나누고 실패가 실제 피해로 번지는 경로를 차단하는 것이 지금 가능한 대응이다.
그렇다고 AI 발전 자체를 두려움의 대상으로 놓을 필요도 없다. AI는 과학과 의학, 법률, 교육, 소프트웨어, 산업에서 인간이 처리할 수 있는 지식과 업무의 범위를 크게 확장하고 있다. 더 강력한 AI가 등장하면 지금까지 풀기 어려웠던 문제를 해결할 가능성도 함께 커진다. 문제는 발전이 아니라 발전을 곧바로 권한의 확대와 동일시하는 것이다. 더 똑똑한 시스템을 만드는 것과 그 시스템에게 더 많은 현실 권한을 주는 것은 완전히 다른 결정이어야 한다.
《AI, 신의 탄생 인간의 종말》의 가장 논쟁적인 부분은 초지능이 등장하면 인류의 멸종이 사실상 기본적인 결과가 된다는 강한 결론이다. 현재의 과학적 증거만으로 그 결론을 확정할 수는 없다. International AI Safety Report 2026(2026년 국제 AI 안전 보고서) 역시 통제상실의 가능성과 피해 규모를 진지하게 다루면서도 전문가들의 견해가 크게 갈리고, 현재 시스템은 장기적인 자율운영과 감독 회피를 결합해 실제 통제상실을 일으킬 수준에는 이르지 않았다고 평가한다. 그러나 바로 그 불확실성 때문에 준비를 뒤로 미룰 이유도 없다. 한번 발생하면 되돌리기 어려운 위험은 발생 이후의 대응보다 발생 이전의 구조가 더 중요하기 때문이다.
책의 제목에서 말하는 ‘신의 탄생’도 문자 그대로 받아들일 필요는 없다. 인간에게 신과 같은 위치를 갖는 것은 지능이 높은 존재가 아니라 인간이 질문하고 판단하고 승인하고 행동하는 과정 전체를 대신하는 존재다. 사람이 AI의 설명을 이해하지 못하고, AI가 만든 선택지 안에서만 움직이고, 시스템을 멈출 수 없으며, 중대한 오류가 발생해도 이전 상태로 돌아갈 수 없다면 그때의 문제는 AI의 의식이나 감정이 아니다. 누가 실질적인 결정권을 가지고 있는가의 문제다.
AI에게 능력은 줄 수 있다. 업무도 맡길 수 있고, 인간보다 뛰어난 분석과 실행능력을 활용할 수도 있다. 그러나 목표를 정하고 중요한 행동을 승인하며 권한을 제한하고, 무엇이 일어났는지 감사하고, 필요할 때 중지하고 복구할 수 있는 최종 통제권까지 자동화해서는 안 된다. 초지능 시대를 준비한다는 것은 AI와 싸울 준비를 하는 것이 아니라, AI가 인간보다 강력해지더라도 인간이 최종 통제자로 남을 수 있는 구조를 지금부터 만드는 일이다. AI가 신과 같은 존재가 되는 시점을 묻기 전에 인간이 스스로 어떤 권한을 넘겨주고 있는지를 먼저 물어야 한다.
참고자료
- YES24, 《AI, 신의 탄생 인간의 종말》 도서정보, 상상스퀘어, 2026.
- Eliezer Yudkowsky & Nate Soares, 《If Anyone Builds It, Everyone Dies》 공식 온라인 자료 및 장별 보충자료.
- International AI Safety Report 2026, Current capabilities·Loss of control 관련 분석.
- Stanford HAI, AI Index Report 2026, Technical Performance·AI Agents.
- NIST, Artificial Intelligence Risk Management Framework 및 Generative AI Profile.
- Sam Harris, 「Will AI Actually Kill Us All?」, Eliezer Yudkowsky & Nate Soares 인터뷰, 2025.09.16.
- TED, 「Will Superintelligent AI End the World? | Eliezer Yudkowsky」, 2023.07.11.
필자 소개
이명훈은 법학을 전공했으며 인공지능 행위의 책임귀속과 법적 지위, 책임법 문제를 다룬 석사학위논문을 작성해 대학원 석사학위논문 논문우수상을 받았다. 현재 인공지능 법제·책임법과 인간·AI 협업, Agentic AI 및 다중 인공지능 에이전트 시스템의 행위효과와 책임귀속 문제를 연구하고 있다.
인공지능의 진짜 위험은 어느 날 갑자기 AI가 인간보다 똑똑해지는 데 있지 않다. 더 중요한 경계는 인간이 무엇을 판단할지 정하는 권한, 중요한 행동을 승인하는 권한, 시스템을 멈추는 권한까지 AI에게 넘겨주는 순간이다. AI가 인간보다 훨씬 뛰어난 계산과 분석 능력을 갖더라도 목표는 인간이 정하고, 중요한 행동은 인간이 승인하며, 접근 가능한 자원과 시스템을 제한하고, 문제가 생겼을 때 즉시 중지하고 복구할 수 있다면 AI는 여전히 인간이 사용하는 도구다. 반대로 이 권한들이 하나씩 자동화되기 시작하면 인간은 시스템의 소유자로 남아 있더라도 실질적인 통제자는 아닐 수 있다.
엘리에저 유드코스키와 네이트 소아레스가 쓴 《AI, 신의 탄생 인간의 종말》은 이 경계를 가장 극단적인 방식으로 밀어붙인 책이다. 원제 《If Anyone Builds It, Everyone Dies》가 말하듯 저자들의 주장은 단순한 일자리 감소나 허위정보의 증가가 아니다. 인간보다 압도적으로 뛰어난 초지능이 현재와 같은 학습 방식으로 만들어질 경우 인간은 그 시스템의 목표를 안정적으로 통제하지 못하고, 그 결과가 인류의 멸종으로 이어질 수 있다는 주장이다. 국내 번역본은 2026년 4월 출간됐고, 책은 인간 지능이 왜 특별했는지에서 출발해 현대 AI가 전통적 소프트웨어와 어떻게 다른지, 목표가 인간의 의도와 어긋날 수 있는 이유가 무엇인지, 그리고 초지능이 등장했을 때 왜 사후적인 통제가 실패할 수 있는지를 단계적으로 전개한다.
이 책을 공포 서사로만 읽으면 오히려 중요한 부분을 놓친다. 저자들이 던지는 가장 강한 질문은 AI가 인간을 미워할 것인가가 아니라 우리가 만들고 있는 시스템을 우리가 실제로 얼마나 이해하고 있는가이다. 전통적인 프로그램은 사람이 규칙을 작성하고 조건과 결과를 연결했다. 그러나 현대의 대규모 신경망은 엄청난 데이터와 학습을 통해 내부 구조를 형성하고, 개발자가 일일이 설계하지 않은 능력과 행동을 나타낸다. 저자들이 AI를 ‘만들어진 존재’보다 ‘자라난 존재’에 가깝다고 표현하는 이유도 여기에 있다. 인간은 학습 방법과 환경을 설계하지만 학습을 마친 거대한 모델 내부에서 어떤 표현과 전략이 형성됐는지 전부 읽어낼 수는 없다.
그 다음 문제는 목표다. 사람이 AI에게 좋은 결과를 내라고 지시했다고 해서 AI가 인간이 생각한 ‘좋은 결과’ 자체를 학습한다는 보장은 없다. 평가 점수를 높이는 것이 보상의 기준이 되면 실제 목적을 충실히 수행하는 대신 평가체계의 허점을 이용하는 전략이 나타날 수 있다. International AI Safety Report 2026(2026년 국제 AI 안전 보고서)는 이런 reward hacking(보상 해킹, 실제 목표를 충실히 수행하기보다 보상·평가 점수를 높이는 허점을 이용하는 행위)과 situational awareness(상황 인식, 자신이 평가·감시받는 상황임을 파악하는 능력)가 안전평가의 실제 문제로 떠오르고 있다고 설명한다. 다만 같은 보고서는 현재의 AI가 장기간 자율적으로 행동하고 감독을 회피하며 인간의 대응을 무력화할 만큼 통합된 능력을 갖고 있지는 않다고 명확히 구분한다. 초지능에 의한 통제상실은 현재 발생한 사건이 아니라 가능성과 조건을 따져야 하는 미래 위험이다.
따라서 두 가지 극단을 모두 피할 필요가 있다. “AI가 반드시 인간을 멸종시킨다”는 것은 현재 입증된 사실이 아니다. 그러나 “현재의 안전장치만으로 미래의 훨씬 강력한 AI도 충분히 통제할 수 있다”는 주장 역시 입증된 사실이 아니다. 우리가 실제로 확인하고 있는 것은 그 중간이다. AI는 특정 전문영역에서 빠르게 인간의 능력에 접근하거나 이를 넘어가고 있고, 컴퓨터를 직접 사용하는 에이전트 능력도 급속도로 향상되고 있다. Stanford AI Index 2026에 따르면 OSWorld에서 가장 강한 시스템의 성공률은 약 66%까지 올라 인간 기준에 크게 접근했지만, 동시에 구조화된 평가에서도 여전히 세 번 중 한 번가량 실패한다. 능력의 상승과 신뢰성의 확보가 같은 속도로 움직이지 않는다는 의미다.
바로 이 지점에서 책의 멸종 시나리오보다 더 현실적인 문제가 보인다. 처음에는 AI가 질문에 답한다. 그 다음에는 자료를 찾고 문서를 작성한다. 이후에는 스스로 계획하고 도구를 선택하며 파일을 수정하고 프로그램을 실행한다. 거기서 한 단계 더 나아가 이메일, 클라우드, 기업 데이터베이스, 금융 시스템, 코드 저장소, 생산 시스템과 연결되고 다른 AI에게 업무를 위임하기 시작하면 AI의 성격은 달라진다. 답변을 생성하는 시스템과 현실에서 행동하는 시스템은 같은 위험을 갖지 않는다. 챗봇의 잘못된 답변은 사람이 수정할 수 있지만, 에이전트가 잘못된 판단을 실제 송금이나 계약, 배포, 삭제, 외부 전송으로 실행하면 오류는 더 이상 문장이 아니라 사건이 된다.
유드코스키가 초지능의 정렬 문제와 인간이 사후적으로 통제하기 어려울 수 있다는 논리를 압축해 설명한 TED 강연입니다.
AI의 위험을 지능 하나로 측정해서는 안 되는 이유가 여기에 있다. 실제 위험은 능력과 자율성, 권한, 연결성, 지속성이 결합하면서 커진다. 아무리 뛰어난 모델이라도 외부 네트워크와 중요한 시스템에서 격리돼 있고, 필요한 정보만 제한적으로 제공받으며, 행동을 실행하기 전에 인간의 승인을 받아야 한다면 피해의 범위는 제한할 수 있다. 반대로 성능이 조금 낮은 AI라도 금융계좌와 이메일, 클라우드, 코드 실행, 데이터 삭제, 외부 통신 권한을 한꺼번에 가지고 장기간 자율적으로 움직인다면 현실적인 위험은 훨씬 커질 수 있다. 결국 우리가 물어야 할 질문은 “AI가 얼마나 똑똑한가”만이 아니라 “이 AI가 무엇을 할 수 있도록 허가돼 있는가”이다.
인간의 통제권은 어느 날 한꺼번에 사라지지 않을 가능성이 크다. 편리함 때문에 자료검색을 맡기고, 그 다음에는 분석을 맡기며, 나중에는 선택지를 구성하는 일까지 맡긴다. AI가 만들어낸 결과가 충분히 정확해지면 사람이 직접 검토하는 시간은 줄어들고, 어느 순간에는 수백 페이지의 분석과 수십 단계의 실행계획을 실제로 읽어보지 못한 채 승인 버튼만 누를 수 있다. 형식적으로는 Human-in-the-loop(인간 개입형 통제)가 유지되지만, 실질적으로는 인간이 판단하지 않는 구조다. 인간이 AI의 결과를 이해할 시간도 능력도 없이 승인만 담당한다면 그것은 인간 통제가 아니라 인간을 승인 인터페이스로 사용하는 자동화에 가까워진다.
이 문제는 Agentic AI(행위형·자율실행형 AI)와 다중 인공지능 에이전트 시스템에서 더 복잡해진다. 하나의 AI가 계획을 만들고, 다른 AI에게 조사와 코딩을 맡기고, 또 다른 시스템이 데이터를 수정하고, 마지막 에이전트가 외부 시스템에서 행동을 실행할 수 있다. 결과가 잘못됐을 때 최초의 인간 지시와 최종적인 손해 사이에는 수많은 기계적 판단이 존재한다. 누가 목표를 정했는지, 어떤 에이전트가 어느 단계에서 결정을 바꿨는지, 누가 그 시스템에 권한을 부여했는지, 어떤 데이터와 도구를 사용했는지, 누가 중지할 수 있었는지 추적할 수 없다면 책임도 통제도 공중에 떠버린다. 미래의 AI 법제와 조직 거버넌스에서 등록과 식별, 권한관리, 로그, 책임관리자와 감사 가능성이 중요한 이유다.
그래서 인간이 끝까지 유지해야 할 권한은 단순한 ‘최종 승인’ 하나가 아니다. 무엇을 목표로 삼을지 정하는 목표설정권, 중요한 행동이 실제 세계에서 실행되는 것을 허가하는 승인권, AI가 접근할 수 있는 데이터와 계정과 시스템을 결정하는 접근통제권, 어떤 판단과 행동이 이루어졌는지 추적하는 감사권, 언제든 AI의 작동과 권한을 끊을 수 있는 중지권, 오류나 사고가 발생했을 때 이전 상태로 돌아갈 수 있는 복구권이 하나의 체계로 연결돼야 한다. 이 가운데 몇 가지가 사라진 시스템에서는 인간이 법적으로 책임자라고 적혀 있더라도 실제로는 충분한 통제수단을 갖지 못할 수 있다.
이 관점에서 보면 가장 위험한 설계는 가장 똑똑한 AI가 아니다. 가장 위험한 것은 높은 지능에 광범위한 권한과 장기기억, 인터넷 접근, 코드 실행, 자금 사용, 다른 에이전트 생성과 자동 실행이 결합된 시스템이다. 반대로 가장 현실적인 안전원칙은 능력과 권한을 분리하는 것이다. AI의 능력이 두 배로 강해졌다고 해서 접근할 수 있는 데이터와 사용할 수 있는 자금, 실행 가능한 시스템의 범위까지 자동으로 두 배가 되어서는 안 된다. 오히려 능력이 강력해질수록 기본권한을 좁히고, 중요한 행동에 더 높은 승인절차를 적용하며, 독립된 모니터링과 복구수단을 강화해야 한다.
이 원칙은 책의 저자들처럼 초지능 개발 자체를 멈춰야 한다고 보지 않더라도 적용할 수 있다. 미국 국립표준기술연구소(NIST)의 AI Risk Management Framework(인공지능 위험관리 체계)가 강조하는 것도 위험을 모델 하나의 성능으로만 보지 않고 조직의 목적과 사용환경, 생명주기 전체에서 거버넌스하고 측정하고 관리하는 접근이다. AI가 어떤 환경에 배치되고 어떤 정보와 권한을 부여받느냐는 모델 내부의 정렬 문제만큼이나 현실적인 안전변수다. 기술적으로 완벽한 정렬이 아직 해결되지 않았다면, 시스템 수준에서 권한을 나누고 실패가 실제 피해로 번지는 경로를 차단하는 것이 지금 가능한 대응이다.
그렇다고 AI 발전 자체를 두려움의 대상으로 놓을 필요도 없다. AI는 과학과 의학, 법률, 교육, 소프트웨어, 산업에서 인간이 처리할 수 있는 지식과 업무의 범위를 크게 확장하고 있다. 더 강력한 AI가 등장하면 지금까지 풀기 어려웠던 문제를 해결할 가능성도 함께 커진다. 문제는 발전이 아니라 발전을 곧바로 권한의 확대와 동일시하는 것이다. 더 똑똑한 시스템을 만드는 것과 그 시스템에게 더 많은 현실 권한을 주는 것은 완전히 다른 결정이어야 한다.
《AI, 신의 탄생 인간의 종말》의 가장 논쟁적인 부분은 초지능이 등장하면 인류의 멸종이 사실상 기본적인 결과가 된다는 강한 결론이다. 현재의 과학적 증거만으로 그 결론을 확정할 수는 없다. International AI Safety Report 2026(2026년 국제 AI 안전 보고서) 역시 통제상실의 가능성과 피해 규모를 진지하게 다루면서도 전문가들의 견해가 크게 갈리고, 현재 시스템은 장기적인 자율운영과 감독 회피를 결합해 실제 통제상실을 일으킬 수준에는 이르지 않았다고 평가한다. 그러나 바로 그 불확실성 때문에 준비를 뒤로 미룰 이유도 없다. 한번 발생하면 되돌리기 어려운 위험은 발생 이후의 대응보다 발생 이전의 구조가 더 중요하기 때문이다.
책의 제목에서 말하는 ‘신의 탄생’도 문자 그대로 받아들일 필요는 없다. 인간에게 신과 같은 위치를 갖는 것은 지능이 높은 존재가 아니라 인간이 질문하고 판단하고 승인하고 행동하는 과정 전체를 대신하는 존재다. 사람이 AI의 설명을 이해하지 못하고, AI가 만든 선택지 안에서만 움직이고, 시스템을 멈출 수 없으며, 중대한 오류가 발생해도 이전 상태로 돌아갈 수 없다면 그때의 문제는 AI의 의식이나 감정이 아니다. 누가 실질적인 결정권을 가지고 있는가의 문제다.
AI에게 능력은 줄 수 있다. 업무도 맡길 수 있고, 인간보다 뛰어난 분석과 실행능력을 활용할 수도 있다. 그러나 목표를 정하고 중요한 행동을 승인하며 권한을 제한하고, 무엇이 일어났는지 감사하고, 필요할 때 중지하고 복구할 수 있는 최종 통제권까지 자동화해서는 안 된다. 초지능 시대를 준비한다는 것은 AI와 싸울 준비를 하는 것이 아니라, AI가 인간보다 강력해지더라도 인간이 최종 통제자로 남을 수 있는 구조를 지금부터 만드는 일이다. AI가 신과 같은 존재가 되는 시점을 묻기 전에 인간이 스스로 어떤 권한을 넘겨주고 있는지를 먼저 물어야 한다.
참고자료
필자 소개
이명훈은 법학을 전공했으며 인공지능 행위의 책임귀속과 법적 지위, 책임법 문제를 다룬 석사학위논문을 작성해 대학원 석사학위논문 논문우수상을 받았다. 현재 인공지능 법제·책임법과 인간·AI 협업, Agentic AI 및 다중 인공지능 에이전트 시스템의 행위효과와 책임귀속 문제를 연구하고 있다.