Hugging Face 发布 NeoMME:260M/800M 多模态多语言编码器
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与图像 patch,从零训练,不依赖预训练视觉塔或因果语言模型。
Hugging Face 推出 NeoMME 系列多模态多语言编码器,含 260M 和 800M 两个规模,用单个双向 Transformer 同时处理文本 token 与图像 patch,从零训练,不依赖预训练视觉塔或因果语言模型。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,支持 ColBERT 式后期交互检索,并提供完整训练方案。
Papers with Code 采用混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 向量召回,并通过 RRF 算法融合两路结果。系统使用 Qwen/Qwen3-Embedding-0.6B 生成 256 维 L2 归一化向量,目前为来自 arXiv 和 Daily Papers 的超过 110,000 篇论文维护嵌入向量。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate、Stanford-NLP ColBERT 检查点和 colpali-engine 视觉文档检索模型都能通过同一套 API 加载。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断 ColBERT 式检索的接入成本与索引代价。