Molmo2

VLM
ビデオグラウンディング対応の完全オープン VLM
作者
公開

2026年2月3日

最終更新

2026年8月8日

Molmo2 (Multimodal Open Language Model 2) は、Allen Institute for AIとワシントン大学が開発した完全オープンなVision-Language Model (VLM) familyである。中心的な機能は、動画内のeventやobjectが「いつ、どこに」現れるかを示す video grounding である。

本書は、この機能を支えるopen data pipeline、model family、grounding評価を、proprietary systemとの報告上の比較を含めて整理する。

論文 · Code · Demo