Molmo2
VLM
ビデオグラウンディング対応の完全オープン VLM
Molmo2 (Multimodal Open Language Model 2) は、Allen Institute for AIとワシントン大学が開発した完全オープンなVision-Language Model (VLM) familyである。中心的な機能は、動画内のeventやobjectが「いつ、どこに」現れるかを示す video grounding である。
本書は、この機能を支えるopen data pipeline、model family、grounding評価を、proprietary systemとの報告上の比較を含めて整理する。