샌프란시스코의 영상 검색 스타트업이 아마존과 벤처캐피탈로부터 1억 달러 규모의 투자를 받았습니다. 이번 투자는 영상 분석 기술의 상용화 가능성을 인정한 것으로 보입니다.

영상 검색 AI 스타트업, 1억 달러 투자 유치
Nvidia의 지원을 받는 영상 검색 스타트업 Twelve Labs가 Amazon을 포함한 투자자들로부터 1억 달러를 조달했습니다. 이번 B 시리즈 투자는 NEA와 Naver가 주도했으며, Radical Ventures, Index Ventures, Korea Investment Partners 등이 참여했습니다. Amazon의 클라우드 서비스 AWS는 Trainium 칩에서 회사의 워크로드를 호스팅하기 위한 다년간의 계약을 체결했으며, 개발자들이 AI 애플리케이션을 구축할 수 있도록 새로운 모델을 서비스에 출시할 예정입니다.
한국 태생 엔지니어들이 설립하고 샌프란시스코에 본사를 둔 Twelve Labs는 영상을 검색 가능하고 이해 가능하게 만드는 AI 모델을 개발하고 있습니다. 회사의 목표는 방대한 영상 아카이브에 접근하고 이를 더 쉽게 수익화하는 것입니다. CEO이자 공동 창립자인 Jae Lee는 “5년 전 우리는 영상이 텍스트가 아니라 인간이 세상을 배우는 방식과 가장 유사한 신호 데이터라는 대담한 가정을 했습니다”라고 말했습니다.
현재 세계 데이터의 약 90%가 영상이지만, 대부분은 아카이브에 방치되어 있어 규모에 맞게 쿼리하거나 분석하기 어렵습니다. 대규모 언어 모델은 프레임을 샘플링할 수 있지만 콘텐츠를 놓치는 경향이 있습니다. 이를 해결하기 위해 Twelve Labs는 여러 유형의 데이터를 동시에 처리할 수 있는 모델을 구축했습니다.
혁신적인 영상 분석 기술의 작동 원리
Twelve Labs의 주력 모델인 Marengo 3.0은 원본 영상을 변환하여 기계가 음향, 음성, 동작 전반에 걸쳐 검색할 수 있도록 합니다. 회사의 Pegasus 1.5 모델은 그 결과물을 AI 도구나 애플리케이션을 위해 파싱 가능한 데이터로 구조화합니다. 이는 문서를 브라우저에서 검색 가능하게 만드는 마크업 언어와 유사한 방식으로 작동합니다.
두 모델이 함께 작동하면서 회사가 수집한 모든 영상의 스택을 형성하며, 시간이 지남에 따라 검색 정확도를 높이는 것을 목표로 합니다. 크리에이터와 엔터테인먼트 회사들은 자신의 영상 아카이브를 검색 가능한 시스템에 입력할 수 있습니다. 이를 통해 1954년 영화 ‘온 더 워터프론트’의 말론 브란도의 택시 장면이나 1986년 월드컵의 디에고 마라도나의 논란이 된 ‘신의 손’ 골 같은 특정 장면을 찾기가 훨씬 쉬워집니다.
Twelve Labs는 또한 텍스트 명령을 통해 검색, 설명, 계획 및 실행이 가능한 영상 에이전트를 개발 중입니다. Lee는 “우리는 아직 영상 에이전트의 이름을 정하지 않았습니다”라고 말했으며, 약 200명 규모의 팀은 서울과 샌프란시스코에 균등하게 분산되어 있습니다.
광범위한 산업 응용과 고객층 확대
영상에는 방송, 영화, 회의, 공장, 병원, 경기장, 드론, 위성 등 엄청난 양의 정보가 포함되어 있지만, 대부분은 여전히 파일명, 폴더, 캡션, 트랜스크립트, 인간의 기억을 통해 접근됩니다. Twelve Labs의 목표는 모든 영상의 매 초를 주소 지정 가능하고 검색 가능하며 에이전트가 사용 가능하게 만드는 것입니다. 이러한 기술은 엔터테인먼트, 광고, 스포츠, 의료 등 다양한 분야에서 혁신적인 변화를 가져올 수 있습니다.
회사의 고객 목록에는 수백만 시간의 아카이브 콘텐츠를 보유한 할리우드 스튜디오, 광고 회사, 소셜 미디어 인플루언서, 스포츠 프랜차이즈 소유자들이 포함되어 있습니다. 구체적인 고객으로는 Toronto Raptors 소유사인 Maple Leaf Sports & Entertainment Ltd., AMC Global Media Inc., UNICEF 등이 있습니다. 이러한 다양한 고객층은 Twelve Labs의 기술이 여러 산업에서 실질적인 가치를 제공하고 있음을 보여줍니다.
스타트업의 기술은 특히 대규모 영상 라이브러리를 관리하는 조직들에게 큰 이점을 제공합니다. 기존의 수동 검색 방식에서 벗어나 AI 기반의 자동화된 검색으로 전환함으로써 시간과 비용을 절감할 수 있습니다. 또한 이전에 접근하기 어려웠던 영상 콘텐츠의 가치를 새롭게 발굴할 수 있는 기회를 제공합니다.
영상 검색 기술 활용 시 알아두면 좋은 팁
영상 검색 AI를 효과적으로 활용하려면 먼저 자신의 영상 아카이브를 체계적으로 정리하는 것이 중요합니다. 고화질의 원본 파일을 보관하고, 가능하면 기본적인 메타데이터(촬영 날짜, 장소, 주요 인물 등)를 미리 입력해두면 검색 정확도가 높아집니다. 또한 정기적으로 아카이브를 업데이트하고 중복 파일을 제거하는 것도 시스템 효율성을 높이는 데 도움이 됩니다.
검색 쿼리를 작성할 때는 구체적이고 명확한 표현을 사용하는 것이 좋습니다. 예를 들어 ‘파란 셔츠를 입은 사람’이나 ‘자동차 사고 장면’ 같은 구체적인 설명이 ‘사람’ 또는 ‘사건’이라는 모호한 표현보다 더 정확한 결과를 제공합니다. 여러 검색 조건을 조합하여 사용하면 원하는 콘텐츠를 더 빠르게 찾을 수 있습니다.
조직 내에서 영상 검색 시스템을 도입할 때는 팀원들을 위한 기본 교육을 실시하는 것이 효과적입니다. 시스템의 기능과 검색 방법을 미리 숙지하면 업무 효율성이 크게 향상됩니다. 또한 정기적인 피드백을 수집하여 시스템을 지속적으로 개선하면 조직 전체의 생산성 향상으로 이어질 수 있습니다.
영상 검색 AI에 대한 자주 묻는 질문
Q1. 기존의 텍스트 기반 검색과 영상 검색 AI의 가장 큰 차이점은 무엇입니까?
A1. 기존 방식은 파일명이나 수동으로 입력한 설명에만 의존하기 때문에 영상의 실제 내용을 정확히 파악하기 어렵습니다. 반면 Twelve Labs의 기술은 영상의 음향, 음성, 동작 등을 동시에 분석하여 더 정확하고 포괄적인 검색이 가능합니다. 이를 통해 사용자는 원하는 콘텐츠를 훨씬 빠르고 효율적으로 찾을 수 있습니다.
Q2. 이 기술이 개인 사용자도 활용할 수 있을까요?
A2. 현재 Twelve Labs의 서비스는 주로 대규모 영상 아카이브를 보유한 기업과 조직을 대상으로 하고 있습니다. 그러나 기술이 발전하고 비용이 낮아지면서 향후 개인 사용자도 이러한 기술을 활용할 수 있을 것으로 예상됩니다. 예를 들어 개인의 가족 영상이나 여행 영상을 쉽게 검색하고 정리할 수 있는 서비스가 나올 수 있습니다.
※ 본문은 일반 독자를 위한 요약 설명이며, 자문이 아닙니다.