This paper proposes a new approach to improve vision-language models for visual retrieval, which can handle long visual contexts and large numbers of distractors. Practitioners might care because it can lead to better performance on image and video benchmarks.
Firehose
Filtered to Papers, tagged “visual retrieval” · clear filters
Browse: People · Companies · Papers · Podcasts · Hacker News · Deep dives