Dense Video-to-Video Retrieval with Spatio-Temporal Scene Graphs

기존의 텍스트 기반 비디오 검색 알고리즘은 주로 짧은 텍스트 질의에 대해 관련 있는 비디오를 검색하는 방법에 초점을 맞춰왔다. 하지만 이러한 텍스트 질의는 하나의 키워드 또는 문장으로 요약될 수 없는 실세계의 긴 비디오의 복잡한 의미 구조를 표현하기 어렵다는 한계가 존재한다. 또한, 비디오 질의에 대해 유사한 비디오를 검색하는 방법은 콘텐츠 기반 비디오 추천, 불법 복제 비디오 탐지 등의 다양한 애플리케이션에 대한 확장 가능성에도 불구하고 많은 주목을 받지 못했다. 본 논문에서는 비디오의 고밀도 캡션(dense captions)을 이용하여 비디오 간의 의미적 유사도를 정의하는 방법을 통해 새로운 비디오-비디오 검색 문제를 정의하고, 시공간 장면 그래프로 표현되는 패턴 매칭을 통해 질의 비디오에 대해 관련 있는 비디오를 검색하는 알고리즘을 제안한다. 실세계의 긴 비디오를 포함하는 데이터셋 MOMA-LRG에서의 실험으로, 제안하는 방법의 우수한 성능을 확인하였다.

Authors

Publication Details

Journal
Journal of KIISE
Published
2026-08-24
DOI
https://doi.org/10.5626/jok.2026.53.8.714
Primary Topic
Multimodal Machine Learning Applications
Type
article
Field-Weighted Citation Impact
0.00
Controls
|||
ALL TIME
JAN
FEB
MAR
APR
MAY
JUN
JUL
AUG
SEP
article

Dense Video-to-Video Retrieval with Spatio-Temporal Scene Graphs

Seongah Kim, Youngchae Chee, Eun-Sol Kim
Journal of KIISE
Multimodal Machine Learning Applications
article

Dense Video-to-Video Retrieval with Spatio-Temporal Scene Graphs

Seongah Kim, Youngchae Chee, Eun-Sol Kim
article en

Abstract

기존의 텍스트 기반 비디오 검색 알고리즘은 주로 짧은 텍스트 질의에 대해 관련 있는 비디오를 검색하는 방법에 초점을 맞춰왔다. 하지만 이러한 텍스트 질의는 하나의 키워드 또는 문장으로 요약될 수 없는 실세계의 긴 비디오의 복잡한 의미 구조를 표현하기 어렵다는 한계가 존재한다. 또한, 비디오 질의에 대해 유사한 비디오를 검색하는 방법은 콘텐츠 기반 비디오 추천, 불법 복제 비디오 탐지 등의 다양한 애플리케이션에 대한 확장 가능성에도 불구하고 많은 주목을 받지 못했다. 본 논문에서는 비디오의 고밀도 캡션(dense captions)을 이용하여 비디오 간의 의미적 유사도를 정의하는 방법을 통해 새로운 비디오-비디오 검색 문제를 정의하고, 시공간 장면 그래프로 표현되는 패턴 매칭을 통해 질의 비디오에 대해 관련 있는 비디오를 검색하는 알고리즘을 제안한다. 실세계의 긴 비디오를 포함하는 데이터셋 MOMA-LRG에서의 실험으로, 제안하는 방법의 우수한 성능을 확인하였다.

Journal of KIISEVol. 53(8)
Openalex Percentile: Top 12%
Multimodal Machine Learning Applications
AI Navigator

Ask Laika to Summarize, Analyze, and Connect papers live on the map.

Summarize Papers & Methodologies

Extract key findings, datasets, and comparative methods across publications.

Benchmark Rankings & Visual Analytics

Rank top research institutions, authors, funders, topics, and journals by Field-Weighted Citation Impact (FWCI) and paper volume with instant charts.

Connect Distant Disciplines

Bridge topological clusters on the map to find hidden collaborative intersections.