跳到正文
Back to Feed

总结

阿里云1月8日在通义智能硬件展发布多模态交互开发套件,集成千问、万相、百聆三款通义基础大模型,并预置十多款覆盖生活、工作、教育娱乐等场景的Agent与MCP工具,支持语音、视频、图文等交互并可与物理世界交互。套件宣称可适配30多款ARM、RISC-V和MIPS终端芯片,降低硬件接入与开发门槛;端到端语音时延低至1秒、视频1.5秒,并接入阿里云百炼生态与A2A兼容三方Agent,面向AI眼镜、学习机、陪伴玩具和机器人等应用。

正文

IT之家 1 月 8 日消息,在今日的阿里云通义智能硬件展上, 阿里云全新发布多模态交互开发套件 。 该套件集成了千问、万相、百聆三款通义基础大模型,并预置十多款生活休闲、工作效率等领域的 Agent 和 MCP 工具,不仅能听、会看,还能思考并且与物理世界交互, 可应用于 AI 眼镜、学习机、陪伴玩具、智能机器人等硬件设备 。 阿里云多模态交互开发套件宣称为硬件企业和解决方案商提供低开发门槛、响应速度快、场景丰富的平台,IT之家附亮点如下: 适配 30 多款终端芯片,硬件可快速接入 在芯片层面,该套件适配了 30 多款主流 ARM、RISC-V 和 MIPS 架构终端芯片平台,满足市面上绝大多数硬件设备的快速接入需求。 未来,通义大模型还将与玄铁 RISC-V 实现软硬全链路的协同优化,实现通义大模型家族在 RISC-V 架构上的高效部署和推理性能。 集成通义大模型,搭配 AI 硬件交互专有模型 在模型优化层面,除通义模型家族外,阿里云还针对大量多模态交互场景进行分析,推出适合 AI 硬件交互的专有模型,全面支持全双工语音、视频、图文等交互方式,端到端语音交互时延低至 1 秒,视频交互时延低至 1.5 秒。 预置 MCP 工具与 Agent,接入百炼平台生态 此外,该套件预置十多款 MCP 工具和 Agent,覆盖生活、工作、娱乐、教育等多个场景。例如,基于预置的出行规划 Agent,用户可直接调用路线规划、旅行攻略、吃喝玩乐探索等能力。 该套件还接入了阿里云百炼平台生态,用户不仅可以添加其他开发者提供的 MCP 和 Agent 模板,还能通过 A2A 协议兼容三方 Agent,扩展了应用的能力边界,帮助企业灵活搭建业务场景。 阿里云还在现场展示了面向 智能穿戴设备、陪伴机器人、具身智能 等领域的解决方案。 例如,在 AI 眼镜领域,基于千问 VL、百聆 CosyVoice 等模型,阿里云打造了感知层、规划层、执行层以及长期记忆的完整交互链路,可一站式实现同声传译、拍照翻译、多模态备忘录、录音转写功能。 面向家庭陪伴机器人场景,基于千问模型和多模态交互套件,阿里云推出的解决方案不仅可实时监测异常状况,并及时告警信息推送,用户还能基于关键词查找、定位视频,与机器人进行对话交互和控制设备等。
发布时间: