英伟达推全新视觉语音模型NVEagle 可以看图聊天

2024年09月02日 15:27 次阅读稿源：Pingwest品玩条评论

英伟达联合 Georgia Tech、UMD 和 HKPU 的研究团队推出了全新的视觉语言模型 ——NVEagle。据悉，NVEagle 能够理解复杂的现实场景，通过视觉输入进行更好的解读和回应。

它的设计核心在于将图像转化为视觉标记，再与文本嵌入相结合，进而提升了对视觉信息的理解。NVEagle包括了三个版本:Eagle-X5-7B、Eagle-X5-13B 以及 Eagle-X5-13B-Chat。其中，7B 和13B 版本主要用于一般的视觉语言任务，而13B-Chat 版本则专门针对对话式 AI 进行了微调，能够更好地进行基于视觉输入的互动。

NVEagle 的一个亮点在于采用了混合专家（MoE）机制，能够根据不同任务动态选择最合适的视觉编码器，这极大提升了对复杂视觉信息的处理能力。该模型已在 Hugging Face 上发布，方便研究人员和开发者使用。

对文章打分

英伟达推全新视觉语音模型NVEagle 可以看图聊天

2 (67%)

1 (33%)

已有条意见

编辑精选

加载中...

Top 10

本周本月

招聘

英伟达推全新视觉语音模型NVEagle 可以看图聊天

对文章打分

英伟达推全新视觉语音模型NVEagle 可以看图聊天

最新资讯

编辑精选

热门评论

相关文章

美伊冲突期间英伟达、亚马逊临时关闭迪拜办事处

带宽22TB/s目标难以实现英伟达下调“Vera Rubin”VR200所用HBM4规格

NVIDIA新驱动解决风扇停转问题但悄悄限制RTX 50 GPU电压

解决风扇控制异常 NVIDIA“翻车”驱动已修复并重新上线

官方庆祝GeForce 3诞生25周年全球首款可编程着色器GPU

GeForce 3迎来25岁从此开启了PC游戏黄金时代

Top 10

微信新能力上线可查图片使用次数

极客湾疑似遭"全网封杀"!背后力量深不可测？

极客湾遭"封杀"引热议连YouTube视频都下架了

微信新能力上线可查图片使用次数

苹果不再允许用户扛着MacBook到苹果零售店拷贝Final Cut Pro

极客湾疑似遭"全网封杀"!背后力量深不可测？