
视觉预训练只需要约四分之一的文档 Token,便能取得远超文本预训练的增益。
来自中科大与上海人工智能实验室联合团队的这一实验结果,证明了在真实的训练语料中,图片往往承载着文字无法无损翻译的视觉逻辑。
若仅靠 OCR 将立体知识强制降维为一维文本,模型最终捕获的不过是知识的碎片。
为了打破这一局限,团队提出了一种全新的视觉预训练范式:在连续视觉表征空间中"预测下一个视觉单元",让模型能够直接从图文交织的视觉文档中汲取最原始、最完整的科学知识。
目前,这项技术已成功应用于上海人工智能实验室 Intern-S2-Preview 35B/397B 系列多模态大模型的预训练中,有效提升了模型的科学推理与多模态理解能力。值得一提的是,相关研发均基于国产昇腾算力平台完成,并成功实现了面向大规模预训练的深度适配与优化。

△在统一表征空间进行视觉预训练

△相同语料在视觉预训练和文本预训练对比示意图实验发现发现一:从视觉文档中,也能学到更强的语言智能
研究首先验证了一个核心预期:如果原始文档页面比解析后的纯文本保留了更完整的知识,那么,直接从这些视觉文档中学习,也应当为模型带来更强的科学推理能力。
实验结果验证了这一判断。在保持训练设置一致的情况下,视觉预训练(VP)在 MMLU-Pro、GPQA Diamond 等纯文本推理基准上,全面优于纯文本预训练(TP),且该趋势在不同模型架构上稳定出现。

△推理能力评测对比

这说明:模型学习到的并不只是图像的表面特征,而是视觉与文本内容共同承载的知识。
发现二:视觉预训练的收益随训练规模持续增长,呼应 Scaling law
一种预训练范式能否支撑基础模型发展,关键不仅在于它是否有效,更在于它能否从不断扩大的数据与计算规模中持续获益。
实验表明,VP 展现出了清晰的 Scaling 趋势:随着科学文档训练量持续增加,VP 相对于文本预训练的优势并未趋于饱和,而是在多个基准上稳定扩大。
元股证券:ygzq.hk
△视觉预训练增益随着训练规模增大
进一步分析显示,VP 的收益与页面中的视觉结构密度密切相关。在以文字为主、视觉结构较少的样本上,VP 与文本预训练表现接近;随着视觉信息的占比增加,VP 的优势显著扩大。
更重要的是,这种增长建立在更紧凑的视觉表示之上。对于完全相同的科学 PDF,解析后的文本约包含 800 亿个 Token,而视觉表示仅包含约 200 亿个视觉 Token。换言之,VP 仅使用约四分之一的文档 Token,便取得了超过文本预训练的效果,体现出更高的信息密度与扩展效率。
发现三:无需显式图文配对监督,也能促进跨模态对齐
传统多模态预训练通常依赖大量图文对、图片描述或人工标注。VP 使用的却只是未经标注的原始文档页面,没有显式的图文配对监督。
尽管如此,经过视觉预训练后,模型中的视觉与文字表征仍然变得更加接近:配对图文表征的余弦相似度由 0.631 提升至 0.907,表征空间的全局结构与局部邻域也呈现出更强的一致性。
这种跨模态对齐进一步迁移到了实际任务中。在 MMMU-Pro 等多模态基准上,VP 在不同模型架构下均优于文本预训练。这意味着,模型在已有语言知识与视觉结构之间建立了联系。

△多模态能力评测对比方法介绍
如果说传统语言模型的训练是"根据上文猜下一个词",VP 做的就是"根据前面的视觉内容猜下一个视觉表征"。二者形式相似,区别在于预测对象从离散文字 Token 变成了连续视觉潜表征,具体实现如下。
第一步,让原始页面以"视觉序列"进入模型。
原始 PDF 先被渲染成页面图像,再由冻结的视觉编码器转换为一组连续特征。视觉编码器保持不变,相当于提供稳定的"答案空间";模型学习的不是还原每一个像素,而是预测更抽象的内容表征,从而减少颜色、噪声等低层细节的干扰。
第二步,只保留有信息的前景内容。
科学文档中页边距、空白区占比很高。系统依据局部像素方差和亮度过滤低信息 Patch,只保留文字、公式、图表、表格等前景区域,并按页面从左到右、从上到下的顺序排列,同时保留位置关系。
第三步,预测"下一个视觉潜表征"。
前景特征通过输入投影进入语言模型。在因果注意力下,当前位置只能看到前面的视觉内容;模型的隐藏状态再经轻量预测头,去匹配下一块前景特征。训练采用带批内负样本的对比损失:预测结果既要靠近正确目标,也要与其他 Patch 区分开。
第四步,让文字和视觉共用同一个"大脑"。
文本样本继续做下一词预测,视觉样本做下一视觉潜表征预测,两类数据按固定比例交替进入同一自回归骨干。训练时更新共享语言模型、输入投影和预测头,视觉编码器保持冻结。因此,视觉学习信号会直接更新承载语言能力的模型参数,而不是停留在外挂视觉模块中。
未来,随着预测目标进一步拓展到图像、视频与交互数据,模型或许能够逐步建立对现实更完整的内部表征。视觉预训练正是迈向这一方向的一步。改变的不只是输入模型的数据形式,更是模型获取知识、建立预测与理解世界的方式。
论文标题:Scalable Visual Pretraining for Language Intelligence
论文链接:https://arxiv.org/abs/2607.09657
HuggingFace 链接:https://huggingface.co/papers/2607.09657
模型链接:https://huggingface.co/internlm/Intern-S2-Preview
https://huggingface.co/internlm/Intern-S2-Preview-397B
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
� � 我们会 ( 尽量 ) 及时回复你 : )
� � 点亮星标 � �
科技前沿进展每日见证券配资平台入口
优配网提示:本文来自互联网,不代表本网站观点。