평가 바꾸니 미·중 격차 7주→3개월
안전 연구 시간 확보 나선 美
기술 우위 수익화가 관건
인공지능(AI) 개발 경쟁을 이끌어온 미국 빅테크 일각에서 속도를 늦추자는 목소리가 나오고 있다. 안전장치가 기술 발전을 따라갈 시간을 확보하자는 취지다. 중국의 추격에도 이런 제안이 가능한 배경에는 미국의 기술 우위가 생각보다 뚜렷하다는 판단이 깔려 있다는 분석이 나온다. 실제 업무 수행 능력까지 따지면 미·중 격차가 여전히 작지 않다는 것이다.
다리오 아모데이 앤스로픽 최고경영자(CEO)는 이달 공개한 글에서 AI 모델의 능력 향상 속도를 조절하고 외부 평가단의 상시 검증을 도입하자고 제안했다. 앞서 데미스 허사비스 구글 딥마인드 CEO도 지난 7월 안전성 평가체계를 제안하며 필요할 경우 선도 기업들의 개발 속도를 조정할 수 있다고 밝혔다.
그 배경은 중국과의 기술 격차였다. 아모데이 CEO는 미국 기업들이 속도를 늦출 수 있는 범위가 중국에 대한 기술적 우위에 달려 있다고 설명했다. 그 격차를 유지하기 위해 첨단 AI 반도체 수출 제한과 기술 유출 차단도 제시했다. 선두 지위를 유지하면서 안전 연구에 쓸 시간을 확보하자는 구상이다.
김일혁 KB증권 연구원은 보고서를 통해 AI 평가기관 '아티피셜애널리시스'의 지수 개편에 주목했다. 기존 평가 방식에서 약 7주로 나타났던 미·중 AI 모델의 격차가 평가 방식 변경 이후 약 3개월로 커졌다는 것이다. 며칠 사이 기술 격차가 급격히 벌어졌다기보다 평가 잣대를 바꾸자 기존 점수에서 충분히 드러나지 않던 차이가 나타났다는 의미다.
아티피셜애널리시스는 이달 초 지수를 개편하면서 복잡한 지식 업무와 업무 자동화 평가를 강화했다. 새로 반영한 'AA-브리프케이스'는 수주에 걸친 프로젝트를 구성하는 업무들을 평가한다. 단답형 정답뿐 아니라 자료를 활용해 요구받은 결과물을 완성하는 능력을 살폈다.
공개된 시험에만 강한 모델을 걸러내는 장치도 강화했다. 지난 7일 공개한 지수 v4.3에서 비공개 과제나 정답을 사용하는 평가의 가중치는 45%로 높아졌다. 시험 문항에 맞춘 최적화가 실제 활용 능력을 과장할 가능성을 줄이려는 취지다. KB증권은 이러한 변화가 미·중 격차가 더 크게 나타난 배경이라고 설명했다.
아티피셜애널리시스는 모델 사용 단가 외에 평가 과제 수행에 실제로 들어간 비용도 비교했다. AI를 활용할 기업이 따져야 할 것도 업무 한 건을 완성하는 데 드는 총비용과 시간이다. 저렴한 모델이라도 반복 작업과 사람의 수정이 많이 필요하면 도입 효과는 기대에 못 미칠 수 있기 때문이다.
결국 실무 능력에서 우위를 유지한다면 AI 모델을 만드는 기업들은 새 모델을 내놓는 간격을 조정하면서 검증에 시간을 더 배분할 여지가 생긴다. 안전하게 업무를 수행하는 능력 자체가 기업 고객을 확보하는 경쟁력이 될 수도 있다.
김 연구원은 "앞으로 성공률과 작업 시간, 안전성 평가가 강화되면 미국과 중국의 격차는 더 벌어질 수 있다"며 "미국의 AI 우위는 달러를 비롯한 미국 자산이 흔들리는 걸 막아주는 요소"라고 설명했다.




