小米开源音频理解模型小米模型实现声音理解新SOTA
声音理解能力新SOTA,小米全量开源了音频理解模型。
MiDashengLM-7B,基于Xiaomi Dasheng作为音频编码器和Qwen2.5-Omni-7B Thinker作为自回归解码器,通过创新的通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解。
其性能在22个公开评测集上刷新多模态大模型最好成绩,单样本推理的首Token延迟(TTFT)仅为业界先进模型的1/4,同等显存下的数据吞吐效率是业界先进模型的20倍以上。
小米开源音频理解模型小米模型实现声音理解新SOTA
声音理解能力新SOTA,小米全量开源了音频理解模型。
MiDashengLM-7B,基于Xiaomi Dasheng作为音频编码器和Qwen2.5-Omni-7B Thinker作为自回归解码器,通过创新的通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解。
其性能在22个公开评测集上刷新多模态大模型最好成绩,单样本推理的首Token延迟(TTFT)仅为业界先进模型的1/4,同等显存下的数据吞吐效率是业界先进模型的20倍以上。
猜你喜欢
【71评论】【3点赞】
【151评论】【19点赞】
【18评论】【1点赞】
【1评论】【1点赞】
【67评论】【1点赞】
【10评论】【1点赞】
作者最新文章
热门分类
科技TOP
科技最新文章