中国中医科学院西苑医院张翠珍医生黄牛预约代挂号电话AI之问:智能的另几种可能
黄牛号贩子跑腿代挂号(13241153586)微信需要挂号联系客服(13241153586)各大医院服务项目!专家挂号,办理住院加快.检查加快,产科建档,指名医生挂号北京,上海,南京,天津.广州,各大医院代挂号

AI论道
舒 勇
2022年,大语言模型ChatGPT的推出,掀起了全球人工智能行业的大模型发展热浪。
彼时,“参数越多、数据规模越大、算力越强,智能水平就越高”被奉为行业准则。大量资金涌入大模型领域,千亿参数成为行业标配,万卡集群成了入局门槛,业内一度形成共识:不做大模型的AI企业,会被市场淘汰。
而时至今日,行业的实际发展并未达到最初预期。千亿参数模型单次训练成本需以千万元计,推理环节算力消耗惊人;数据规模扩大300倍,模型性能仅能提升个位数百分点;全行业无一款大模型能实现AGI(通用人工智能)的落地……
一个疑问在学界和业界浮现:依托大语言模型实现超级智能,是否进了一条“死胡同”?
当下的大语言模型,本质是一个“超级语言匹配器”,靠在海量文本里摸透词语搭配的统计规律,顺着前文逐个选出概率最高的词拼接成句。它只能做到“知其然”,却做不到“知其所以然”。这就好比一个人背下了整本百科全书,却从未走出过房门。它能在文字互动里表现得如同智者,放到物理环境中却像懵懂的婴儿。
那么除了大模型之外,还有其他选择吗?答案是肯定的。
现在,已经有越来越多研究者开始探寻大模型以外的其他可行方案,并且要比我们预想的更丰富,也更深刻。
1 路径一:世界模型
纽约大学教授、图灵奖得主杨立昆一直推崇“世界模型”的发展路径,它的主要思路是:让AI在自身的“虚拟空间”里搭建出一个对应真实世界、可进行交互的动态模拟系统。它要理解物理规则,例如物体为什么会向下掉落、力如何传递、空间是怎样构成的。它需要把研究方向从“预测下一个Token”转向“预测下一个物理状态”。
美国斯坦福大学教授李飞飞提出的“空间智能”和这个思路一脉相承——智能不只是文字层面的逻辑游戏,更包含对空间的感知、想象以及推理能力。她所定义的世界模型需要拥有三种能力:生成性、多模态性、交互性。
国内也有团队在探索类似的研发方向。仝人智能科技(西安)有限公司创始人吴易明认为,与其给机器人输入大量数据,不如直接给它装上一个可感知物理空间的“大脑”,让它可以像人类一样自主认知周遭世界。该团队考量人类认知的具身特征,搭建出一套可解释的数学架构,这套方案的训练成本较低,和大模型动辄数千万美元的训练开销形成了鲜明对比。
从世界模型的角度看来,智能的本质,是要去理解真实世界的运行规律。一个仅能生成通顺语句的AI,和一个可以真正独立思考的AI,二者间的差距,很可能比我们设想的还要大得多。
2 路径二:非Transformer架构
Transformer架构这种全靠“注意力机制”的路子,自2017年被提出后,几乎占据了所有大模型的主流应用位置。但它的缺陷也很明显:它的计算复杂度呈二次方增长,生成的Token越长,对算力的要求就越高,这意味着,模型规模变大后,运算效率反而会出现下降。
当前,一批新的架构正在挑战这个垄断。美国产业界已有以RWKV为代表的新一代线性架构,它把计算复杂度从二次方降到了线性,计算量不再随内容长度暴涨,而是匀速增长,可以有效降低运行能耗。
在国内,也有研发团队在探索更贴近生物智能的技术路线。中国科学院自动化研究所团队发布的类脑脉冲大模型“瞬悉1.0”,借鉴了大脑神经元工作机制,提出新的线性计算架构。该模型仅需主流模型约2%的数据量,就能达到相当的语言理解与推理性能,且全流程可在国产GPU平台上运行,为自主可控的非Transformer架构提供了可行路径。
此外,上海岩芯数智人工智能科技有限公司自研的Yan架构大模型,以神经元选择激活为核心,是国内首个通过备案的非Transformer通用大模型,可在低功耗工控机等终端设备上流畅运行。
寻找效率更高、能耗更低、更贴近真实智能规律的新架构,是AI产业突破成本瓶颈、实现规模化落地的刚需。就像飞机的发明,并未被模仿鸟类扇动翅膀的思路所困囿,人工智能的最终产业形态,也不会止步于Transformer架构的衍生版本。
3 路径三:端侧智能
当前的大模型还有一个特征——“中心化”,所有智能都集中在云端,需要依赖规模庞大的数据中心支撑运行。
可智能真的有必要这样集中吗?
需要挂号联系客服 北京上海南京广州天津西安医院黄牛号贩子跑腿代挂号
