此为临时链接,仅用于预览,将在短期内失效。
长江云

硬核中国上新了 | 华科大团队攻克多模态交互壁垒 打造机器人数字分身

长江云新闻  2026-08-15 20:06:14
分享到:

人形机器人要做到“像真人一样自然交互”,最大难点之一,就是让语言、表情、动作、口型同步合拍。华中科技大学机械学院研发的视觉语言交互模型VLI,破解了多模态信息不同步的行业痛点,让机器人言行表情高度统一,这项技术已在光谷开启产业转化。

机器人:现在我们已经确定了用户和场景,接下来需要设计agent(智能体)架构,需要哪些输入?

学生:课表、考试时间,还有自习室的开放情况。

机器人:所以你们的agent不是一个静态日程表,而是一个能够持续跟进的学习生活规划助手。

在华中科技大学的教室里,一堂特殊的课程正在上演。代替老师站上讲台的,是一台轮式人形机器人。机器人的一言一行,都和老师本人一模一样,除了授课外,它还可以跟同学们进行问答互动,而这份超强“复刻”能力,源自于华科大机械学院最新研发的视觉语言交互模型“VLI”。

华中科技大学机械科学与工程学院教授 李敏:针对老师授课的数据来进行训练,模型会模拟老师所做的一些语言、动作、表情,更重要的是,它会把老师所传授的知识、教学的风格作为类似一种知识库的形式,就像数字分身。

当前,人形机器人最大的痛点之一,是语言、表情、动作、口型“各管各的”,说话时表情跟不上,动作时口型对不上,缺乏真实的互动感。原因在于这些信息分属不同模态,传统方案只是把多个模型简单拼凑。而VLI用一个统一框架,像大脑一样同步处理多模态信息,让机器人从语言输出到动作、表情展示,都做到一致。

华中科技大学机械科学与工程学院教授 李敏:我们这个模型是个双层的,它有一种我们讲的快脑和慢脑。慢脑需要对环境的信息,包括一些交互的信息,进行统筹分析、做决策,以我们现在的调研来看,还没有竞品。

目前,团队开发的轮式人形机器人已搭载VLI模型进入真实垂域场景测试,它们不仅在高校协助教师对学生开展个性化辅导,还在医院“化身”导医,为患者指引科室、提供就诊建议。同时,团队已组建武汉慧力科机器人有限公司落户光谷,探索将这项技术搭载在仿生人形机器人上,为更多领域的专家打造实体数字分身。

(长江云新闻记者 汪佳睿 卞勇)

责任编辑 李小涵
分享到:

定制服务