Goldfish

使用场景电影制作人员使用Goldfish模型分析电影片段,提取关键情节。电视剧编辑利用Goldfish模型理解剧情发展,优化剪辑。视频内容分析专家通过Goldf...

  • Goldfish

    类别:AI视频搜索,AI视频摘要,视频理解,长视频处理,短视频理解,短视频基准测试,人工智能,字幕与视频帧结合,普通产品,开源,
    官网:https://vision-cair.github.io/Goldfish_website/ 更新时间:2025-08-01 18:37:08
  • 使用场景

    电影制作人员使用Goldfish模型分析电影片段,提取关键情节。

    电视剧编辑利用Goldfish模型理解剧情发展,优化剪辑。

    视频内容分析专家通过Goldfish模型进行内容审核,确保视频内容合规。

    产品特色

    高效检索机制:通过收集与指令相关的前k个视频片段来处理长视频。

    MiniGPT4-Video:为视频片段生成详细描述,促进检索过程。

    长视频基准测试:在TVQA-long基准测试中取得41.78%的准确率。

    短视频基准测试:在MSVD、MSRVTT、TGIF和TVQA短视频基准测试中表现出色。

    视频描述生成:使用EVA-CLIP获取视觉标记,并将它们转换为语言模型空间。

    字幕与视频帧结合:通过结合视频帧和对齐的字幕提升模型性能。

    适应性:能够处理电影或电视剧等长视频序列。

    使用教程

    1. 将长视频分解为多个片段。

    2. 使用Video Descriptor(如MiniGPT4-Video)为每个片段生成描述。

    3. 根据用户查询,检索与指令最相关的片段。

    4. 将检索到的片段信息发送到答案模块,获取最终答案。

    5. 通过EVA-CLIP获取每个帧的视觉标记。

    6. 将视觉标记与字幕文本标记结合,生成语言模型空间的标记。

    7. 将生成的标记输入到语言模型中,进行进一步处理和分析。

    8. 利用生成的描述和分析结果,进行视频内容的理解和应用。