Embodied Minds Lab at Harvard

AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark

Wenhao Chai*, Enxin Song*, Yilun Du, Chenlin Meng, Vashisht Madhavan, Omer Bar-Tel, Jenq-Neng Hwang, Saining Xie, Christopher Manning
ICLR
2025