물리AI 모델 실패 과반이 데이터 문제, 마진은 레이블링 구간으로 이동
물리 세계를 다루는 AI가 텍스트 AI와 다른 병목에 걸렸다. 700명 이상의 전문가를 대상으로 한 2026년 조사에서 물리AI 모델 실패의 과반이 데이터 문제에서 비롯된 것으로 나타났다. 같은 시기 ARM Institute는 방산 제조를 위한 로봇 프로젝트 공모를 발표했다. 두 소식은 물리AI 밸류체인에서 마진이 어느 구간으로 흐르는지를 보여준다.
무슨 일인가
IEEE Spectrum이 보도한 조사에 따르면, 지난 10년간 텍스트 기반으로 발전한 AI의 프론티어가 물리 세계 데이터로 이동했다. 영상, LiDAR 포인트클라우드, 센서 스트림 같은 고차원 데이터가 물리 공간에서 인식·추론·행동하는 시스템을 구동한다.
보고서는 물리AI를 실제로 구축하는 팀들이 어떻게 작동하는지를 기록했다. 데이터 문제가 모델 실패의 대다수를 차지하며, 데이터 큐레이션이 더 큰 아키텍처를 추구하는 것보다 중요하다는 결론이다. 주석(annotation) 작업은 비용이 크고 낭비적이다. 팀들은 대개 모든 데이터에 레이블을 붙인 뒤 프로덕션 전에 상당 부분을 폐기한다. 조사 결과는 데이터 수집이 아니라 데이터 작업(data work)이 제품을 출시하는 팀과 정체되는 팀을 가르는 이유임을 보여준다고 보고서는 밝혔다.
같은 시기 ARM Institute는 미 국방부(DoW) 제조 기술을 위한 프로젝트 공모(Project Call 27-01)를 시작했다. 금속 가공, 드론, 탄약, 조선 등 방산 수요를 다루는 기술을 요구하며, 국방부의 민간 산업기반(CIB) 및 자체 산업기반(OIB)으로 전환 계획이 검증된 제안을 선호한다고 밝혔다. 기술준비도(TRL) 4~7 단계, 프로덕션 환경에서 최종 시연이 필수 조건이다. 콘셉트 제출은 2026년 9월 16일, 최종 선정은 12월 11일, 프로젝트 시작은 2027년 2월 1일, 종료는 2028년 1월 31일이다.
산업 구조에서 무엇이 바뀌나
물리AI 밸류체인에서 마진이 데이터 수집보다 큐레이션과 레이블링 구간으로 이동하고 있다. 첫 번째 기사가 제시한 조사 결과는 모델 실패 원인 과반이 데이터 문제라는 점, 주석 작업에 큰 비용이 들지만 대부분 폐기된다는 점을 명시했다. 이는 원시 데이터(raw data) 자체보다 어떤 데이터를 남기고 어떻게 가공하는지를 결정하는 큐레이션 역량이 더 높은 가치를 갖는다는 뜻이다.
텍스트AI 시대에는 웹 크롤링과 대규모 말뭉치 확보가 경쟁 지점이었다. 물리AI는 영상, LiDAR, 센서 스트림처럼 차원이 높고 노이즈가 많은 데이터를 다룬다. 수집한 데이터 전체에 레이블을 붙이는 것은 비용 대비 효율이 낮고, 프로덕션 단계에서 어차피 버려진다. 따라서 '무엇을 레이블링할지'를 판단하는 큐레이션과, '어떻게 레이블링할지'를 정의하는 주석 설계가 병목이 된다. 이 구간을 장악한 쪽이 모델 성능과 출시 속도를 좌우하게 된다.
ARM Institute의 공모는 이 흐름의 수요 측면을 보여준다. 방산 제조는 고신뢰·고정밀 데이터가 필요하며, TRL 4~7 단계 요구는 실험실 단계를 넘어 프로덕션 환경에서 검증된 데이터 파이프라인을 원한다는 뜻이다. 민간·자체 산업기반으로 전환 계획을 요구하는 것은 일회성 실증이 아니라 반복 가능한 공급망 구축을 전제로 한다. 이는 데이터 큐레이션과 주석 인프라를 갖춘 계층이 방산 제조 로봇 공급망에서 구조적 위치를 확보할 기회가 열렸음을 시사한다.
국내 밸류체인에서는
국내에서는 센서 모듈, 영상 처리 반도체, LiDAR 부품을 공급하는 부품 계층이 이 흐름의 간접 영향권에 있다. 물리AI가 고차원 데이터를 다루려면 센서 해상도와 처리 속도가 올라가야 하므로 센서와 프로세서 수요는 증가한다. 하지만 원문에서 드러난 병목은 하드웨어가 아니라 데이터 큐레이션이다. 따라서 부품 공급 계층은 수요 증가를 기대할 수 있지만, 마진은 데이터 가공 구간으로 흘러간다.
국내에는 영상 레이블링, 3D 포인트클라우드 주석, 센서 데이터 정제를 수행하는 데이터 가공 업체들이 존재한다. 이 계층은 대체로 단순 아웃소싱 구조로 알려져 있으며, 큐레이션 기준을 자체적으로 설계하기보다 고객사가 정한 기준에 따라 작업하는 쪽에 가깝다. 원문 조사 결과대로라면, 큐레이션 기준 자체를 설계하고 어떤 데이터를 남길지 판단하는 역량이 마진의 원천이 된다. 국내 데이터 가공 계층이 단순 작업에서 벗어나 큐레이션 설계까지 내재화하는지 여부가 마진 확보의 갈림길이 될 것으로 보인다.
방산 로봇 쪽은 국내에서도 수요가 증가하는 영역이다. ARM Institute 공모가 보여주듯, 방산 제조는 TRL 4~7 단계에서 프로덕션 환경 검증과 공급망 전환 계획을 요구한다. 국내 로봇 시스템 통합(SI) 계층은 제조 현장 구축 경험을 갖췄지만, 방산 요구 수준의 데이터 파이프라인과 큐레이션 인프라를 함께 제공하는지는 별개 문제다. SI 계층이 데이터 가공 계층과 협업 구조를 만들거나 내재화하지 않으면, 방산 로봇 공급망에서 실행 역할에 머물고 설계 주도권은 해외나 데이터 인프라 보유 주체에게 넘어갈 가능성이 있다.
지켜볼 지점
- 물리AI 모델 공급사들이 자체 데이터 큐레이션 팀을 내재화하는지, 외주로 남기는지. 내재화가 늘면 큐레이션 계층이 모델 개발사 내부로 흡수되며, 독립 데이터 가공 업체는 단순 작업 하청으로 남는다.
- ARM Institute 공모 선정 결과에서 데이터 파이프라인과 큐레이션 인프라를 포함한 제안이 얼마나 선정되는지. 많다면 방산 로봇 공급망에서 데이터 구간의 구조적 위치가 확정되는 신호다.
- 국내 로봇 SI 업체들이 데이터 가공 역량을 인수하거나 협업 구조를 공시하는지. 이는 SI 계층이 실행 역할을 넘어 설계 주도권을 확보하려는 움직임으로 해석할 수 있다.
이 글은 위 원문 기사를 근거로 작성한 산업 구조 분석입니다. 국내 밸류체인 관련 서술은 원문에 없는 추론이며, 특정 종목에 대한 투자 권유나 매매 판단의 근거가 아닙니다. 투자 판단과 그 결과에 대한 책임은 투자자 본인에게 있습니다. 원문에 없는 수치는 담지 않았습니다.
댓글
댓글 쓰기