大模型落地普及之后,行业讨论的焦点,慢慢从模型效果转向底层支撑,智能算力成为串联起 AI 各个应用环节的关键底座。市面上不断迭代的新一代智能算力,不再只是机房里冷冰冰的硬件参数,正在实实在在渗透进不同行业的业务流程当中,带动整条产业链路发生变化。

过去很长一段时间,算力供给更多服务传统互联网业务。服务器集群主要承接网页访问、短视频分发、云端存储这类常规任务。AI 大模型爆发之后,训练、微调、推理整套流程对硬件提出完全不一样的需求。大模型训练需要大批量显卡协同运算,单次训练任务就要调动上千张算力卡长时间不间断工作,对带宽、散热、集群调度能力都提出更高标准。传统通用算力架构,跑大模型任务时会出现效率下滑,资源浪费的情况,很难匹配现在 AI 业务的实际运行状态。
新一代智能算力,就在这样的现实需求之下迭代成型。硬件层面,算力芯片不再单纯追求单卡峰值性能,芯片之间互联带宽、集群通信能力被放到重要位置。单张算力卡性能再强,如果集群内部数据传输存在瓶颈,大批量硬件联动的时候整体效率会被严重拖慢。不少厂商推出的新一代算力产品,重点优化芯片互联通路,降低多卡协同的数据延迟,让大规模集群可以稳定跑通百亿、千亿参数模型的完整训练流程。

软件调度体系同样是新一代智能算力不可忽视的部分。有不少案例里,硬件配置规格很高,但上层调度框架适配不到位,硬件实际利用率只能维持在三成到四成。新一代算力平台配套的调度系统,可以区分训练任务和推理任务的资源诉求,动态分配显存、算力资源。多用户同时使用一套算力集群的时候,系统可以做任务错峰排布,避免高负载任务抢占全部资源,提升整套硬件集群的实际使用时长。
产业端的变化,能够直观看到新一代算力带来的改变。文创内容行业,过去做 AI 视频生成,短片段生成往往要耗费数十分钟,大分辨率画面还容易出现画面崩坏。依托新一代智能算力集群,单条几十秒的 AI 视频生成耗时被压缩到分钟级别,同一套集群还可以同时承接数十个生成任务。部分影视工作室已经把这套算力接入日常生产链路,用来生成前期概念画面、辅助剪辑素材,减少部分重复性的素材制作工时。
工业领域也在落地对应的算力能力。工厂端的 AI 质检,需要实时读取高清摄像头画面,快速完成缺陷识别。旧有算力方案,会出现画面处理延迟高,并发数量有限的问题。本地化部署的新一代智能算力单元,可以在厂区本地完成图像推理,不用全部回传到远端云端,数据处理响应速度得到提升,同时也减少工厂数据向外传输带来的相关风险。不少制造企业开始搭配这套算力,运行产线质检、设备故障预判类 AI 程序。
不过产业落地过程里,现实层面的问题同样客观存在。高性能智能算力硬件采购成本偏高,中小规模企业一次性搭建专属算力集群,资金压力很大。很多中小企业没有专门技术团队,很难完成算力集群调试、框架适配、运维维护整套工作。针对这类现状,算力云服务模式开始普及,企业不用自建机房,按需调用云端的智能算力资源,按实际使用量结算费用。这种模式降低使用门槛,但也会带来新问题,业务高峰期,大量用户集中调用资源,会出现算力排队,任务等待时间拉长的现象。

地域层面,国内多地开始布局智能算力中心。各地算力中心建设节奏并不统一,部分地区算力硬件堆叠到位,但适配的软件服务、行业解决方案配套跟进偏慢,出现硬件闲置的情况。跨区域算力调度也还处在发展阶段,不同算力平台之间,数据格式、任务调度标准尚未完全打通,跨中心调配算力资源还存在不少现实阻碍。
技术迭代还在持续向前推进,新一代智能算力也在不断更新。算力芯片、互联架构、调度软件还会持续优化,单位算力的使用成本会逐步往下走。后续算力的竞争,不会只停留在硬件参数比拼,硬件和行业场景的适配程度,会成为重要的发展方向。把算力能力和文创、制造、医疗等不同行业的真实业务做结合,解决业务运行里真实遇到的问题,才是智能算力落地产业的核心路径。
整个产业格局,也会跟着算力的迭代持续发生变动。上游硬件研发厂商,中游算力平台服务商,下游各个行业的使用者,各方的协作模式,都将随着智能算力的普及不断演变。