Dense Video-to-Video Retrieval with Spatio-Temporal Scene Graphs
기존의 텍스트 기반 비디오 검색 알고리즘은 주로 짧은 텍스트 질의에 대해 관련 있는 비디오를 검색하는 방법에 초점을 맞춰왔다. 하지만 이러한 텍스트 질의는 하나의 키워드 또는 문장으로 요약될 수 없는 실세계의 긴 비디오의 복잡한 의미 구조를 표현하기 어렵다는 한계가 존재한다. 또한, 비디오 질의에 대해 유사한 비디오를 검색하는 방법은 콘텐츠 기반 비디오 추천, 불법 복제 비디오 탐지 등의 다양한 애플리케이션에 대한 확장 가능성에도 불구하고 많은 주목을 받지 못했다. 본 논문에서는 비디오의 고밀도 캡션(dense captions)을 이용하여 비디오 간의 의미적 유사도를 정의하는 방법을 통해 새로운 비디오-비디오 검색 문제를 정의하고, 시공간 장면 그래프로 표현되는 패턴 매칭을 통해 질의 비디오에 대해 관련 있는 비디오를 검색하는 알고리즘을 제안한다. 실세계의 긴 비디오를 포함하는 데이터셋 MOMA-LRG에서의 실험으로, 제안하는 방법의 우수한 성능을 확인하였다.
Authors
- Seongah Kim
- Youngchae Chee
- Eun-Sol Kim
Publication Details
- Journal
- Journal of KIISE
- Published
- 2026-08-24
- DOI
- https://doi.org/10.5626/jok.2026.53.8.714
- Primary Topic
- Multimodal Machine Learning Applications
- Type
- article
- Field-Weighted Citation Impact
- 0.00