AI 환각발 대중국 군사작전 오발령 사례와 한국의 검증체계 구축 과제
총괄 요약
올봄 미군은 AI 챗봇이 작성을 도운 정보보고서를 근거로 중동 해역 중국 선박에 대한 차단·나포 작전을 준비했으나, 전투기가 출격한 상태에서 마지막 순간 작전을 중단했다. 오류의 원천은 상대국의 기만이 아니라 미군 자체 정보 생산 과정이었으며, 부실한 결론이 표준 보고서 양식을 거치며 제도적 신뢰를 얻은 채 지휘계통에 급속히 유통된 점이 핵심 결함이다. 현재 논의되는 미중 AI 대화체는 상대국 AI 사고 통보에 초점을 두고 있어 이번과 같은 자국 내부 오류를 구조적으로 포괄하지 못하며, 반도체 수출통제 등 핵심 갈등 변수도 의제에서 배제돼 있어 실효성이 제한적이다. 이번 사건은 위기 안정성의 관건이 통보 채널이 아니라 인간 검증 절차의 시점에 있음을 보여준다. 한국은 한미 연합 정보체계에 유입되는 AI 생성 정보에 대해 독자적 검증 절차와 원천 데이터 접근권을 확보하는 것을 선결 과제로 추진해야 한다. 나아가 해당 이슈에 대해 미중을 포함한 국제사회의 대응을 주도하는 외교적 노력을 기울일 필요가 있다.
I. 이슈 상황분석
AI 환각으로 인한 대중국 군사작전 오발령 사례 이슈 상황분석
1. 이슈 배경 및 경과
사건의 발단은 이란전쟁이 진행 중이던 올봄으로 거슬러 올라간다. 미군은 중동 해역을 항해하던 중국 화물선 한 척이 핵무기 프로그램 관련 부품을 싣고 있다는 정보보고서를 접수했다[7][11]. 이 보고서는 AI 챗봇의 도움을 받아 작성됐다[1][4]. 문제는 이 결론이 사실이 아니었다는 점이다. CNN이 인용한 4명의 소식통에 따르면, 해당 보고서는 표준 정보보고서 양식을 거쳐 미군 지휘계통 내부로 급속히 확산됐다[11]. 보고서가 유통되는 데 걸린 시간은 단 몇 분에 불과했다는 크로아티아 매체 보도도 나왔다[11].
이 정보를 근거로 미 군 지휘부는 해당 선박에 대한 차단·나포 작전 계획을 실제로 수립했다[11]. 전투기가 출격했고, 항공기가 이미 공중에 떠 있는 상태에서 작전 중단 여부가 최종 검토됐다[1][9]. 작전은 마지막 순간에 취소됐다[1][4][9]. 스위스 NZZ는 이 사건을 "치명적으로 정밀한 오류"로 규정하며, 부정확한 데이터에 대한 잘못된 기술 신뢰가 재앙적 결과로 이어질 수 있음을 보여준 사례로 평가했다[4].
이 사건은 단독으로 발생한 것이 아니다. 같은 시기 팔란티어 메이븐 AI 표적선정 시스템이 이란 미나브 초등학교를 표적으로 잘못 지정해 어린이 120명을 포함한 150명 이상이 사망한 오폭 사건이 함께 조명됐다[3][6][14]. 오스트리아 데어슈탄다르트는 두 사건을 나란히 보도하면서, 팔란티어 AI가 이란 공습 당시 이미 소실된 영상자료를 최신 자료로 오인했을 가능성을 함께 제기했다[14]. 두 사건 모두 인간의 검증 절차가 AI 산출물의 유통 속도를 따라가지 못했다는 공통된 구조적 결함을 드러낸다.
2. 현재 상황
CNN이 9월 18일 이 사실을 단독 보도하면서 사건이 공개됐다[1][12]. 보도 시점은 공교롭게도 트럼프 대통령이 CNN, MS NOW, 폴리티코 등 언론사에 백악관 출입 제한 조치를 발표하기 직전이었다[14]. 미국 국방 당국은 사건 경위에 대한 공식 해명을 내놓지 않은 상태다. 이 보도는 프랑스어권 서아프리카 매체[13], 핀란드[9], 에스토니아[16], 크로아티아[11], 인도[12], 브라질[7] 등 세계 각지 매체로 빠르게 확산됐다. 이는 미중 관계에서 AI발 우발적 충돌 가능성이 단순히 워싱턴-베이징 양자 문제가 아니라 국제사회 전반의 관심사로 인식되고 있음을 보여준다.
중국 관영매체 글로벌타임스는 이 사건을 미중 AI 안전 협력의 시급성을 뒷받침하는 근거로 활용했다. 중국 측 전문가를 인용해 "허위로 생성된 미국 측 정보가 중국 선박에 대한 미군의 무력행사 계획으로 이어질 뻔했다"는 사실 자체가 양국 간 AI 안전 협력의 긴급성을 보여준다고 평가했다[15]. 이는 중국이 이 사건을 자국 책임 논쟁으로 끌고 가기보다, 미국 내부 정보체계의 결함으로 프레이밍하면서 대화체 참여의 명분으로 삼으려는 태도로 해석된다.
한편 미국 재무장관 베선트는 이미 별도로 미중 AI 대화체 구축 협의가 시작됐다고 밝혔다[17]. 이 협의체는 양국이 국가안보를 위협할 수 있는 AI 사고 발생 시 상호 통보하는 메커니즘을 지향한다[17]. 다만 이 사건이 공개된 시점과 맞물려, 해당 대화체가 실제로 이번과 같은 유형의 사고를 포괄할 수 있는지에 대한 의문이 즉각 제기됐다.
3. 주요 행위자 및 입장
미군 지휘계통은 이번 사건에서 가장 직접적인 당사자다. 문제의 근원은 상대국의 기만이나 해킹이 아니라 자국 정보 생산 절차 내부에서 발생했다[1][4]. 표준 보고서 양식이 오류를 걸러내지 못하고 오히려 제도적 신뢰를 부여하는 통로로 작동했다는 점은, 미군 내부의 정보 검증 체계 자체에 구조적 취약점이 있음을 시사한다. 이는 앞서 팔란티어 메이븐 시스템의 오폭 사건에서도 공통으로 지적된 문제로[3][14], 미군의 AI 도입 속도가 검증 체계 정비 속도를 앞지르고 있다는 평가로 이어진다.
중국 측은 공식 외교 채널을 통한 항의보다는 관영매체를 통한 담론 전개를 택했다. 글로벌타임스는 사건을 미국의 기술적 결함으로 규정하면서, 이를 AI 안전 분야 미중 협력의 필요성을 강조하는 근거로 활용했다[15]. 중국은 이번 사건이 자국 선박에 대한 직접적 군사행동으로 이어지지 않았다는 점에서 확전 대응보다는 협력 프레임을 선택할 유인이 있다.
미 재무부 및 관련 당국은 이미 별도로 미중 AI 대화체 구축을 추진해왔다[17]. 그러나 이 대화체는 설계 단계에서부터 반도체 수출통제 등 미중 AI 경쟁의 핵심 쟁점을 의제에서 배제하고 있다. 국가안보 수준의 AI 사고에 대한 상호 통보에 초점이 맞춰져 있어, 이번 사건처럼 자국 내부 정보 생산 과정에서 발생한 오류를 사전에 포착하거나 예방하는 기능은 애초에 설계 범위 밖에 있다.
중견국 행위자로서 한국은 이번 사건의 직접 당사자는 아니지만, 한미 연합 정보체계에 유사한 구조적 위험이 잠재해 있다는 점에서 이해관계를 갖는다. 팔란티어 메이븐 계열 시스템이 여러 동맹국에 표준화된 형태로 공급되는 구조 자체가 오류 전이 가능성을 내포하고 있다는 지적은 이미 별도로 제기된 바 있다[3].
4. 핵심 쟁점
첫 번째 쟁점은 오류의 발생 지점이다. 이번 사건은 상대국의 기만전술이나 사이버 침투가 아니라, 자국 AI 도구가 생성한 허위 결론이 표준 보고서 양식을 거치며 검증 없이 유통된 데서 비롯됐다[1][4][11]. 이는 미중 AI 경쟁 구도에서 위협이 반드시 외부에서만 오지 않는다는 점을 보여준다.
두 번째 쟁점은 검증 절차의 위치다. 오류에 대한 실질적 검증은 항공기가 이미 출격한 이후, 작전 직전 단계에서야 이뤄졌다[1][9]. 위기관리의 관건이 사후 통보 채널이 아니라 사전 인간 검증 절차의 견고성에 있다는 점이 이번 사례로 다시 확인됐다.
세 번째 쟁점은 진행 중인 미중 AI 대화체의 실효성이다. 이 대화체는 상호 통보 메커니즘에 초점을 두고 있어[17], 이번 사건과 같이 통보 대상이 되기 전 단계에서 발생하는 자국 내부 정보 생산 오류를 구조적으로 포괄하기 어렵다. 반도체 수출통제와 같은 AI 경쟁의 근본 변수가 의제에서 빠져 있다는 점도 대화체가 실제 위기 예방 기능을 수행하는 데 제약으로 작용한다.
네 번째 쟁점은 동맹국 및 중견국의 노출 위험이다. 미군 AI 기반 정보·표적 체계의 오류가 동맹 연합작전 체계로 전이될 가능성은 팔란티어 메이븐 사례에서 이미 확인된 문제다[3]. 한국을 포함한 동맹국은 미국이 주도하는 AI 기반 정보·지휘통제 표준을 수용하는 과정에서, 원천 데이터에 대한 접근권과 독자적 검증 절차를 확보하는 문제를 선결 과제로 검토할 필요가 있다.
II. 이슈 심층분석
AI 환각으로 인한 대중국 군사작전 오발령 사례 심층분석
1. 근본 원인 분석
이번 사건의 오류 원천은 상대국의 기만이나 해킹이 아니었다. 미군 자체의 정보 생산 과정에서 발생한 환각이었다[1][4]. AI 챗봇이 작성을 지원한 정보보고서가 중국 화물선의 화물을 핵무기 프로그램 부품으로 오판했다[7][11]. 이 결론은 근거가 빈약했다. 그럼에도 표준 정보보고서 양식을 통과했다[11]. 형식적 절차를 거쳤다는 사실이 내용의 신뢰성을 담보하지 못했다.
여기서 핵심 문제가 드러난다. AI가 생성한 문장은 정형화된 보고서 형식을 취한다. 이 형식 자체가 심사자에게 신뢰의 신호로 작용한다. 크로아티아 유타르니 리스트는 해당 보고서가 미군 지휘계통 내부에서 불과 몇 분 만에 최고 수준의 경계태세를 촉발했다고 전했다[11]. 정보의 진위 검증보다 확산 속도가 앞선 것이다. 스위스 NZZ는 이를 "치명적으로 정밀한 오류"로 표현했다. 부정확한 데이터에 대한 그릇된 기술 신뢰가 재앙적 결과로 이어질 수 있음을 보여준 사례라는 평가다[4].
동일한 구조적 결함이 이란 미나브 초등학교 오폭 사건에서도 확인됐다. 팔란티어 메이븐 표적선정 시스템은 38일간 약 1만3000개 표적을 식별하는 과정에서 이미 소실된 영상자료를 최신 자료로 오인했을 가능성이 제기됐다[3][14]. 오스트리아 데어슈탄다르트는 두 사건을 같은 날 나란히 보도하며 공통분모를 짚었다[14]. AI 표적선정과 정보분석의 처리 속도가 인간 검증에 필요한 시간을 압축시켰다는 점이다. 이는 개별 시스템의 결함이 아니라 AI 도입 이후 군사 의사결정 구조 전반에 걸친 문제로 봐야 한다.
2. 구조적 맥락
이란전쟁이라는 고강도 위기 상황이 오류 발생의 배경이 됐다. 미군은 이란과의 교전이 진행되던 시점에 중동 해역의 선박 통제 임무를 병행하고 있었다[7][13]. 위기 국면에서는 정보 생산과 소비의 회전 주기가 짧아진다. 지휘관은 신속한 판단을 요구받는다. 이런 환경에서 AI가 제공하는 신속한 정보종합 능력은 매력적인 도구다. 동시에 검증 절차를 생략하게 만드는 유인으로도 작용한다. 전투기가 이미 출격한 상태에서야 오류가 발견됐다는 사실은[1][9], 검증이 작전 개시 이전 단계가 아니라 임계 시점 직전에야 이뤄졌음을 뜻한다.
미중 관계라는 틀에서 보면 이 사건은 우발적 군사충돌의 새로운 경로를 예시한다. 기존의 미중 군사긴장은 대만해협, 남중국해에서의 근접 조우나 회색지대 도발을 중심으로 논의돼 왔다. 이번 사건은 실제 물리적 접촉이나 도발 행위 없이, 순전히 정보 생산 단계의 오류만으로 무력행사 직전까지 갈 수 있음을 보여줬다. 브루킹스연구소는 2023년 정찰풍선 사건을 거론하며, 핫라인 같은 안전장치 없이는 AI 기반 무인기·무인함정이 향후 더 많은 우발적 확전을 촉발할 가능성이 높다고 지적한 바 있다[2]. 이번 사건은 무인 플랫폼이 아니라 정보분석 단계에서도 동일한 위험이 존재함을 확인시켰다.
미중 양국이 별도로 추진 중인 AI 대화체는 이 구조적 위험을 충분히 포괄하지 못한다. 재무장관 베선트가 언급한 미중 AI 대화체는 국가안보를 위협할 수 있는 AI 사고를 상대국에 통보하는 메커니즘에 초점을 맞추고 있다[17]. 이는 양국이 서로에게 발생한 사고를 사후에 알리는 체계다. 그러나 이번 사건처럼 자국 내부 정보 생산 과정에서 발생한 환각은 애초에 상대국에 통보할 유인이 크지 않다. 대화체가 다루는 '사고'의 정의 자체가 이런 유형의 오류를 구조적으로 포착하기 어렵게 설계돼 있다. 게다가 반도체 수출통제처럼 미중 AI 경쟁의 핵심 변수는 이 대화체 의제에서 배제돼 있다. 통보 채널의 실효성이 처음부터 제한적이라는 뜻이다.
3. 역사적 선례 및 유사 사례 비교
가장 근접한 비교 대상은 같은 해 발생한 미나브 초등학교 오폭 사건이다. 이 사건에서는 팔란티어 AI 표적선정 시스템의 오류가 실제 타격으로 이어져 150명 이상이 사망했다[3][6][14]. 유엔 진상조사단은 이를 전쟁범죄에 해당할 수 있다고 판단했다. 반면 백악관은 조사 결과를 즉각 부인했다[3]. 이번 대중국 작전 사례와 미나브 사건의 결정적 차이는 결과의 발현 여부다. 미나브 사건은 검증 실패가 실제 인명피해로 귀결됐다. 대중국 작전은 마지막 순간의 개입으로 물리적 피해를 막았다. 두 사건을 나란히 놓고 보면, AI 오류가 실제 참사로 이어지는지 여부는 우연에 가까운 타이밍의 문제였다는 점이 드러난다. 시스템 설계 단계에서 인간 검증이 구조적으로 보장돼 있었기 때문이 아니다.
더 오래된 선례로는 브루킹스연구소가 언급한 2023년 정찰풍선 사건이 있다[2]. 이 사건은 AI가 개입되지 않은 재래식 오인식 사례였다. 그럼에도 미중 양국 간 위기소통 채널의 부재가 긴장을 증폭시켰다는 점에서 구조적 교훈을 남겼다. 당시에도 사후적으로 핫라인 구축 필요성이 제기됐으나 실질적 진전은 더뎠다. 이번 AI 환각 사건에서 미중 AI 대화체 논의가 재부상한 것은 유사한 패턴이다. 위기 발생 이후에야 소통 메커니즘 논의가 촉발되는 방식이 반복되고 있다.
냉전기 오경보 사례와의 비교도 유효하다. 1983년 소련의 조기경보체계가 미사일 발사를 오탐지한 사건에서는 당직 장교의 개인적 판단이 확전을 막았다. 이번 사건에서는 특정 개인의 판단이 아니라, 항공기가 이미 출격한 이후 최종 검토 단계에서 오류가 포착됐다는 점이 다르다[1][9]. 인간의 개입이 시스템 설계상 보장된 절차가 아니라 우연적 발견에 가까웠다는 점에서, 이번 사례는 냉전기보다 오히려 취약한 위기관리 구조를 드러낸다고 볼 수 있다.
4. 이슈 전개의 핵심 변수
첫 번째 변수는 미군 정보체계 내부의 검증 절차 개편 여부다. 오류가 표준 보고서 양식을 거쳐 신뢰를 얻은 채 유통됐다는 점은[11], AI 생성 정보에 대한 별도의 표기나 등급 체계가 없었음을 시사한다. 향후 미군이 AI 산출물과 인간 검증 정보를 구분하는 절차를 도입하는지, 그리고 그 검증을 작전 개시 이전 단계로 앞당기는지가 관건이다.
두 번째 변수는 미중 AI 대화체의 의제 확장 여부다. 현재 논의되는 틀은 상호 통보에 국한돼 있다[17]. 이 틀이 자국 내부 오류에 대한 투명성 요구까지 포괄하도록 확장될지, 아니면 형식적 채널에 머물지가 위기 안정성을 좌우하는 변수다. 중국 측이 이 사건을 미중 AI 안전 협력의 명분으로 활용하고 있다는 점은[15], 베이징이 이 논의에 적극적으로 나설 유인이 있음을 보여준다. 다만 반도체 수출통제 등 실질적 경쟁 변수가 의제에서 빠져 있는 한, 대화체의 정치적 상징성과 실효성 사이의 간극은 계속될 가능성이 크다.
세 번째 변수는 여론과 정치적 후폭풍이다. CNN의 단독 보도가 트럼프 대통령의 해당 언론사에 대한 백악관 출입 제한 조치 직전에 나왔다는 사실은[14], 이 사건이 미국 국내정치의 언론 통제 논쟁과 맞물릴 소지를 내포한다. 미 국방 당국이 아직 공식 해명을 내놓지 않은 상태에서, 추가 폭로나 의회 차원의 조사 요구가 이어질지 여부가 사건의 파급력을 결정할 것이다.
네 번째 변수는 동맹국 차원의 파급이다. 미군의 AI 기반 정보체계는 한미 연합 정보체계를 포함한 여러 동맹 네트워크와 연동돼 있다. 이번 사건이 보여준 검증 공백이 동맹국에 공유되는 정보의 신뢰성 문제로 확산될 경우, 동맹국들이 미국 주도 AI-C2 표준을 수용하는 과정에서 독자적 검증권을 요구할 유인이 커질 것이다.
이 보고서는 EAI 연구원의 기획에 따라 AI 기반의 정교한 리서치를 바탕으로 EAI 연구원이 최종 작성한 심층분석 보고서입니다.