Language
销售热线:18053720666     售后服务电话:4000-228-799
回到顶部

我科学家为人工智能打造“通用大脑” 以统一架构让AI学会“接龙”

发布者:
发布时间: 2026-02-11

你也许用过智能助手聊天,也见过人工智能(AI)生成精美图像,看过机器人跳舞……但你是否想过,驱动“聊天”“画画”“运动”的,究竟是三套独立的系统,还是同一个“智能大脑”的三种功能?日前,一项由北京智源人工智能研究院主导的重要科研突破在国际学术期刊《自然》发表,为实现真正“看得清、想得通、做得稳”的通用人工智能指明了新方向。这也是我国科研机构主导的大模型原创成果首次在《自然》正刊发表。

论文主要作者、北京智源人工智能研究院理事长、北京大学教授黄铁军指出,这项研究的核心思想非常简洁:以统一架构,让AI学会“接龙”。“无论是阅读文字、欣赏图片,还是观看视频、生成动作,在我们新开发的智源Emu模型的‘眼’里,都被转换成一套‘数字积木’。模型的任务,就是像我们玩歌词接龙游戏那样,始终预测‘下一块积木’应该如何出现。”

“这一思路有迹可循。早在2018年,美国OpenAI公司便基于‘预测下一词’的路线训练GPT模型,并于2022年推出ChatGPT,实现了语言大模型重大突破。”黄铁军团队推测,“预测下一词”的架构或许不仅适用于语言,也能拓展至多种模态,将图像、文本和视频数据在同一架构下统一训练,从而开发出“一脑多能”的多模态大模型。

团队成员介绍,此前全球范围内出现的此类模型,大多采用“专用工具组合”方式:理解语言与图片、生成图片与视频,均由各自独立的模型或工具各司其职。这类分工模式虽目的明确,但协同成本也随之增加。能否训练一个“通才”,采用统一架构处理各类数据、掌握多种技能?研究团队的Emu3模型给出了肯定答案。

Emu3就是这样一个“通才”型AI:当你给它一段文字描述时,它可以生成细节丰富、结构合理的图像;当你给它一张照片及相关问题时,它又能结合视觉信息与常识,进行精准的图像问答与理解;更进一步,它还能生成连续的视频片段——只需给出一个开头,模型便能一帧一帧地输出后续画面,甚至还能像连环画那样,为每段画面配上文字描述。

在升级版Emu3.5中,研究团队通过引入大规模长时序视频训练,使模型从“预测下一个词元”拓展到“预测下一个状态”,开始学习世界随时间演化的统计规律,为迈向更完整的“世界模型”探索了可行路径。

黄铁军表示,这意味着,多模态模型分离的“理解”和“生成”两类能力,首次在同一种简单而统一的建模范式下被系统性打通。

这把“统一建模”的钥匙,其潜力并不止于多模态内容生成。它可以延伸到物理世界,为机器人操作提供可行的动作序列设想,还可以解读脑信号等各种复杂数据。黄铁军介绍,“预测下一个”这一看似朴素的思想,本身蕴含着构建通用智能的基因。《自然》编辑评价,智源Emu3这一成果对构建可扩展、统一的多模态智能系统具有重要意义。

黄铁军表示,这项成果证实了生成式人工智能技术路线的普适性:人类已经掌握了让不同智能在同一体系内涌现的方式,正稳步走上通用人工智能持续演进的道路。(记者晋浩天)


上一篇:无下一篇:无
News / 推荐新闻 More
2026 - 09 - 04
点击次数: 0
与教育工作者和学生家长交流,发现大家有一个共同的关注点:人工智能崛起后,教育该如何提升“人”的价值?推进基础教育扩优提质,一个不能回避的话题是如何处理教育与人工智能的关系。从智能学习伙伴为学生提供个性化辅导,到智能黑板让教学更加生动有趣,人工智能正深度赋能教育发展。与此同时,一些忧虑也不容忽视。比如,遇到难题直接照搬人工智能给出的答案,孩子的思维会越来越懒惰;过多依赖智能设备学习,学生的共情能力和人际交往能力会受到抑制;学习内容良莠不齐,海量信息真假难辨,容易误导青少年的价值观……人工智能赋能教育是大势所趋,但大方向也必须明确:用人工智能解放教学,而不是替代教师;用人工智能增强学习,而不是外包思考。以清华大学附属中学为例,在部分学科、部分年级试点人工智能助教,批改作业、完善课程,老师们则腾出更多时间,重点关注学生的个性化成长。对比着看,人工智能能生成、会推理,单纯以知识传授、标准答案、重复...
2026 - 08 - 27
点击次数: 0
随着新产业、新业态蓬勃发展,基层治理的“问题域”不断拓宽,一些干部情况不熟、经验不足,可能陷入“老办法不管用、新办法不会用”的尴尬。如何破题?不妨从“换位思考”入手。某地一副局长跟着骑手送外卖,原以为他们最关心社保政策,没想到张口就是“别罚我款”“出餐能不能快一点”。这个巨大落差,正是坐在办公室发现不了的痛点。习近平总书记强调:“善于换位思考,走进群众,真诚倾听群众呼声、真实反映群众愿望、真情关心群众疾苦,准确了解群众的所忧所盼。”这指向思想上的认知自觉,更要求行动上的设身处地,想做好并不容易。具体来看,或可分三重境界。许多人对换位思考的理解,止步于脑海里的推演:把群众难题放在自己身上想一想。但视角转换只是第一重,人与人的处境千差万别,肩头的压力、心中的顾虑、利益的考量各不相同,如果只是在脑海里换位,终究隔了一道无形的墙。采访中便遇到过类似情况。有高校干部苦恼,对地下管道进行为期一年的整修...
2026 - 05 - 28
点击次数: 0
2026世界智能产业博览会刚刚落下帷幕,这场盛会集中展示了全球智能科技前沿成果,全景呈现了我国数字经济与智能产业的迭代跃迁。作为观察中国新质生产力发展、研判全球数字产业变革的重要窗口,本届智博会最大的亮点,不在于炫酷技术的集中展演,而在于产业风向的深刻嬗变:褪去概念炒作的虚火、跳出参数比拼的盲从、回归赋能实体的本源。透过这场行业盛会,人们清晰看到,中国智能产业正告别粗放扩张的增长模式,迈入重落地、重融合、重自主、重协同的高质量进阶新阶段。去虚向实、落地为王,是智能产业最鲜明的时代转向。过去一段时期,人工智能、智能装备等领域一度存在“重演示轻应用、重噱头轻实效”的行业乱象,不少技术成果停留在实验室样机、展会展台,难以转化为产业效能、民生福祉。行业热度高涨,但产业根基不牢、落地场景不足,成为制约智能经济提质增效的突出短板。本届智博会上,参展的新技术、新产品、新方案聚焦真实产业痛点、民生堵点,从...
2026 - 02 - 11
点击次数: 20
你也许用过智能助手聊天,也见过人工智能(AI)生成精美图像,看过机器人跳舞……但你是否想过,驱动“聊天”“画画”“运动”的,究竟是三套独立的系统,还是同一个“智能大脑”的三种功能?日前,一项由北京智源人工智能研究院主导的重要科研突破在国际学术期刊《自然》发表,为实现真正“看得清、想得通、做得稳”的通用人工智能指明了新方向。这也是我国科研机构主导的大模型原创成果首次在《自然》正刊发表。论文主要作者、北京智源人工智能研究院理事长、北京大学教授黄铁军指出,这项研究的核心思想非常简洁:以统一架构,让AI学会“接龙”。“无论是阅读文字、欣赏图片,还是观看视频、生成动作,在我们新开发的智源Emu模型的‘眼’里,都被转换成一套‘数字积木’。模型的任务,就是像我们玩歌词接龙游戏那样,始终预测‘下一块积木’应该如何出现。”“这一思路有迹可循。早在2018年,美国OpenAI公司便基于‘预测下一词’的路线训练...
【关闭窗口】【打印】
关注我们:
手机云网站:
分享至:
Copyright © 2020山东飞宏工程机械有限公司    
犀牛云提供企业云服务