跳到主要内容

1 篇文档带有标签「视觉定位」

查看所有标签

LocateAnything Visual Grounding

LocateAnything 扩展的开放词表视觉定位方案——基于 LocateAnything-3B 视觉语言模型,用自然语言「找 / 数」画面中的任意物体、短语定位、文字定位、GUI 元素定位与指点,支持零样本目标检测与计数,适合固定检测器不认识的类别或临时需求。