分享
18. 多模态大模型~2
输入“/”快速插入内容
18. 多模态大模型~2
用户4886
用户4886
2024年1月23日创建
158
311
0
0
•
目前有众多的开源多模态大模型,本节重点介绍
LLaVA
;下图中除了GPT-4V都是开源模型;
ShareGPT4V, LVIS- INSTRUCT4V是基于LLaVA训练出的模型
LLaVA模型介绍
LLaVA是具有里程碑性质的multimodal
•
模型训练
分为2个阶段
:
a.
特征对齐的预训练。只更新特征映射矩阵ProjectW
:
▪
使用了
CLIP的视觉编码器
(CLIP ViT/14 视觉编码器(Vision Encoder)) + LLaVA的特征映射矩阵
•
Vision Encoder相当于给LLM添加眼睛
•
因为CLIP使用的训练dataset非常大,表现非常好; 所以把预训练较好的编码器拿过来用于LLaVA上;
▪
多模态模型的训练是一个求同存异的过程,求同的过程就是图文特征对齐;图像的特征用到CLIP模型,是将图像patch化,把Patch化每个小块的特征映射到单词word一级的特征,这需要加一层特征映射层,即LLaVA中特征映射层;
▪
第一阶段的效果就是输入patch化的图片,问题"请描述这图片",输出,这是一个柿子 => 图~文的对齐
b.
端到端的Fine Tune;特征投影矩阵和LLM都需要进行更新;
▪
由于单模态的大模型的语言部分矩阵不适合处理多模态任务,在fine tune阶段视觉的特征矩阵和语言模型的矩阵,一起学习,都需要更新;
▪
66w的数据规模
◦
LLaVA的核心工作重点还包括如何构建
指令微调的数据集
;
数据也有2个类型数据
:
图-文对齐数据 / 图文指令数据
;而且2个阶段的数据都是开源的;
▪
图文对齐数
据
:是用于更新视觉特征矩阵的数据,是训练第一阶段使用的;
•
目前是使用的开源的数据集:包括LAION dataset,Conception Caption Dataset,SUB Caption Dataset; 共558k数据;
•
组织形式:
基于BLIP短文本描述打标
;conversation / image / id,conversation部分包括问答,问图片内容,答解释;
▪
图文指令数据
:类似语言模型中的instruct tunning的阶段,包括对话,逻辑推理的语料
•
也是开源的数据集: coco, ocr_qa, textvqa, etc
•
LLaVA有2种数据分类,但从数据集的内容形式上看,有3类数据形式:
图片精细描述
,
对话
,
复杂推理
. 图片精细描述,用于第一阶段预训练图文对齐,训练ProjectW矩阵时使用;对话,复杂推理,用于第二阶段Fine Tune,更新ProjectW和LLM时使用;
◦
如何通过GTP4生成
图文指令
:
▪
例如,coco数据集,数据是图文数据,一个图对应着5个描述性短句;
把这5个短句text-only输给GPT,让GPT生成
3类数据
(
图像精细描述
,
对话
,
复杂推理
)
▪
存在论文(ShareGPT4V)说明,
准备这3类数据的最佳实践是使用GPT-4的模型文本推理能力;下面在图形解析小节的实验,说明了此方法
;
▪
构建复杂推理的过程,比前2类特殊,需要使用CV方式构建出一个
描述图片中物体位置
的
Boxs
文本,传给GPT,生成复杂推理的response(GPT-4对文本的理解能力非常厉害,它都可以理解Box里描述的坐标)
准备图文数据,用GPT对开源数据集数据进行增强(复杂推理,需要携带图片中位置的Boxes文本)
•
基于这些任务做一些改造,首先要做的是构造一个适应于这个任务的数据;因此对我们有意义的是,根据自己的需求(只用LlaVA可能不满足自己的要求),基于GPT, 构造一个可以训练LLaVA的数据集
图像解析实战