腾讯AI实验室联合剑桥大学推出大语言模型PandaGPT：支持文本图像音频等跨模态能力-aicg搜索

AI奇点网6月6日报道丨6月2日，来自英国剑桥大学、日本奈良先端科学技术大学院大学、腾讯AI Lab的多位研究人员们在网上公开发布了通用指令跟随大模型PandaGPT（直译过来就是：熊猫GPT）。

据介绍，PandaGPT可以执行复杂的任务，如生成详细的图像描述、编写受视频启发的故事、回答有关音频的问题。PandaGPT可同时接受多模态输入，并自然地组合它们的语义。

PandaGPT在文本、图像/视频、音频、深度、热度（thermal）和IMU六种模态上展示了跨模态能力，但由于ImageBind提供的共享嵌入空间，它只能使用对齐的图像-文本对进行训练。研究人员希望PandaGPT可以作为构建通用人工智能（AGI）的第一步，它可以像人类一样全面地感知和理解不同形式的输入。

值得强调的是，目前的 PandaGPT 版本只使用了对齐的图像 - 文本数据进行训练，但是继承了 ImageBind 编码器的六种模态理解能力，具备在所有模态之间跨模态能力。在实验中，论文作者展示了 PandaGPT 对不同模态的理解能力，包括基于图像 / 视频的问答，基于图像 / 视频的创意写作，基于视觉和听觉信息的推理等等，下面其中一个例子，PandaGPT可以很好的接合图像+音频来判断一个事物：