Text-to-Image · Visual Document Retrieval

Query2Photo 文搜图 EVIE · WeCLIPv2 · C-RADIO

ViDoRe V3 官方口径 + 汽车 / 研报中文闭集

8 卡评测MaxSim / 余弦业务闭集
评测集
V3 图不进仓库,直接读官方 parquet。业务集硬链,闭集找 1。

ViDoRe V3 public

8 领域 × 6 语 · 官方 nDCG@10
64.6%
evie-preview · 约 1.9 万页 · 48 任务宏平均

汽车文搜图

200 问 × 200 手册图 · 闭集
27.5%
evie-preview Hit@1

研报文搜图

502 问 × 502 研报图 · 闭集
67.1%
evie-preview Hit@1
ViDoRe V3
与 EVIE 模型卡同一套 qrels:领域语料编一次,六语 Query 分别检索,再对 48 个任务取平均。
体系模型nDCG@10Hit@1
EVIEevie-preview64.6%
WeCLIPv2weclipv2-tiny1.2%0.8%
WeCLIPv2weclipv2-small1.3%0.9%
WeCLIPv2weclipv2-base2.4%1.8%
WeCLIPv2weclipv2-large5.1%4.7%
C-RADIOcradio-so400m21.3%19.7%
C-RADIOcradio-h24.5%22.0%
业务闭集
中文问题找回唯一对应图。WeCLIPv2 原生中文;EVIE 是页面级后期交互;C-RADIO 走 SigLIP2-g 适配器。
体系模型 汽车 Hit@1汽车 Hit@5 研报 Hit@1研报 Hit@5
EVIEevie-preview27.5%54.5%67.1%85.3%
WeCLIPv2weclipv2-tiny8.0%22.5%22.5%40.2%
WeCLIPv2weclipv2-small5.5%23.5%26.3%46.0%
WeCLIPv2weclipv2-base12.5%27.5%40.0%65.5%
WeCLIPv2weclipv2-large22.5%44.0%42.2%67.7%
C-RADIOcradio-so400m12.5%34.0%25.7%46.6%
C-RADIOcradio-h17.5%42.0%28.1%49.0%
中文图文 · WeCLIPv2
Tiny/Small 方图 ConvNeXt;Base/Large 是 NaViT 任意长宽比。Large 文本塔换 xlm-roberta-large。权重在 Photo2photo/model/weclip。
型号视觉文本输入汽车 Hit@1研报 Hit@1
weclipv2-largeNaViT-L/16xlm-roberta-large任意长宽比 256p 22.5% 42.2%
weclipv2-baseNaViT-B/16xlm-roberta-base任意长宽比 256p 12.5% 40.0%
weclipv2-smallConvNeXt-Sxlm-roberta-base256² 方图 5.5% 26.3%
weclipv2-tinyConvNeXt-Txlm-roberta-base256² 方图 8.0% 22.5%
开源协议

EVIE-Preview 自研可商用

ColQwen3.5 后期交互,ViDoRe 官方口径。微调权重归业务方。

WeCLIPv2 内部开源

微信 MMVision。中文图文主线,NaViT + xlm-roberta,可继续增量预训练。

C-RADIOv4 仅限研究

NVIDIA Research Only。文搜图必须走 siglip2-g 适配器,不能只用 Photo2photo 的 HF 视觉骨干。

业务案例
默认看 EVIE;没有结果时回落到第一个已完成模型。