分享
17. 多模态大模型~1
输入“/”快速插入内容
17. 多模态大模型~1
用户4886
用户4886
2024年1月21日创建
167
331
1
0
•
Outline
◦
多模态大语言模型(MLLM)
定义
◦
发展历程(4个里程碑)
◦
GPT4v实战
◦
图文对话系统搭建
◦
Beyond VL: 支持更多模态输入的大语言模型
◦
使用MLLM完成更多任务,以langchain,agent等方式;
Begin
•
modal
: 是指事情经历发生的方式; 世界是由多种模态信息构成的世界,e.g. 视觉信息,听觉信息,嗅觉信息, etc.
◦
模态~从世界的客体的形式的角度; 六感~从人主体的方法的角度
•
多模态大语言模型(MLLMs)
定义:
◦
由LLM扩展而来的具有
接受
与
推理
多模态信息能力的模型
◦
而最核心的是
接受
(因为LLM目前推理能力大大提高)
◦
e.g. MLLMs接受到音频/视频的信号和prompt,"
听雨声,观察路面情况,判断是否适合出
门", 会结合特征输入运用大模型的能力进行推理,得到结论
•
几个概念的区分
◦
跨模态模型
/
单模态大模型
/
多模态模型
/
多模态
语言大模型
◦
跨模态模型
▪
大部分是针对于3类(视觉,文本,音频)数据,是着重针对不同数据的对齐的模型
•
本课着重介绍
视频(图像描述,目标检测)
到
文本
的生成,在学术界是比较集中比较大的一部分;
文生图
,
文生视频
▪
核心是把视觉的特征和文本的特征进行关联(图和文的特征对齐); 大致的pipeline: 使用visual encoder对视觉编码,得到视觉特征,在LLM进行decode,得到关于图像的句子描述;
▪
浙大, 字节, 腾讯分别提出了3个有价值的项目
•
Real3D-Portrait
◦
Github - yerfor/Real3DPortrait: Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis, ICLR 2024 Spotlight
(
github.com
)
◦
Paper
◦
intro
•
Ani-Portrait
◦
Github - Zejun-Yang/AniPortrait: AniPortrait: Audio-Driven Systhesis of Photorealistic Portrait Animation
◦
paper
◦
youtub: AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation. Beginner's guide - Part 1
▪
Facebook Meta提出了数字人的框架: Audio2Photoreal
•
https://github.com/facebookresearch/audio2photoreal
•
可以基于音频驱动360度的3D人物,合并了动作和口部形态
▪
TTS,
音色克隆
, 少样本,
•
GPT-SoVITS:
◦
可以跨语言的音色克隆;无法做到洞察文本语义来感情色彩