This paper proposes a new approach to improve vision-language models for visual retrieval, which can handle long visual contexts and large numbers of distractors. Practitioners might care because it can lead to better performance on image and video benchmarks.
Firehose
Filtered to Papers, tagged “visual KV cache” · clear filters
Browse: People · Companies · Papers · Podcasts · Hacker News · Deep dives