算力紧缺背景下 亚马逊AWS要求工程师削减CPU资源浪费

据一位知情会议参与者透露,亚马逊云科技(AWS)管理层于5月与工程师召开会议,传递出一则严峻指令:为保障旗下热门弹性云服务器业务EC2未来能为全部客户提供充足算力,工程师必须想尽一切办法节约资源。 该知情人士表示,需节约的算力既包括通用中央处理器(CPU)服务器资源,也包含长期供不应求的AI专用芯片算力。过去数十年互联网产业均依靠CPU芯片支撑运转;而如今A...

据一位知情会议参与者透露,亚马逊云科技(AWS)管理层于5月与工程师召开会议,传递出一则严峻指令:为保障旗下热门弹性云服务器业务EC2未来能为全部客户提供充足算力,工程师必须想尽一切办法节约资源。 该知情人士表示,需节约的算力既包括通用中央处理器(CPU)服务器资源,也包含长期供不应求的AI专用芯片算力。过去数十年互联网产业均依靠CPU芯片支撑运转;而如今AWS内部不少工程师反映,申请CPU服务器算力用于研发的等待时间大幅拉长。 有工程师称,以往几小时就能获批的服务器算力,现在要等上好几天,极易导致项目无法按期交付。这名工程师在AWS任职多年,从未遭遇如此漫长的资源排期。 另有熟悉该内部规划的人士透露,AWS已给各团队设定今年下半年前完成算力压降的期限。工程师正在关停软件开发完成后闲置的EC2虚拟服务器(即云实例),腾挪出这部分算力资源供给外部客户使用。 今年席卷整个科技行业的算力荒,如今已蔓延至传统通用算力领域。众所周知,英伟达图形处理器(GPU)等AI芯片需求暴涨,直接造成AI专用算力短缺;而受AI产业拉动,CPU服务器也陷入供给紧张。配套CPU使用的内存芯片产能不足、数据中心物理机柜空间有限,进一步加剧了算力缺口。 金融AI服务商埃伦迪尔实验室联合创始人兼董事谢静(音译)分析,越来越多员工借助AI智能体开发软件,企业CPU消耗量随之激增。她接触到的客户企业,员工人均IT开支直接翻倍——大量工作交由AI智能体处理,需要采购更多云端算力,而这类任务普遍依赖CPU。 即便在AI模型研发流程中,CPU也承担关键工作:例如AI企业训练模型前预处理数据时,需依靠CPU读取文档、图片、视频等原始素材。 谢静表示:“当下绝大多数模型开发、生成与运行任务,对CPU的需求量远高于以往。” 英特尔首席执行官谭仲明在4月财报电话会上透露,当时AI推理(模型线上运行)场景中CPU与GPU算力配比为1:4;到7月,英特尔首席财务官大卫・津斯纳称二者配比已接近1:1,AMD、安谋(Arm)高管也给出类似判断。 AWS则否认自身运营策略发生变动,并在官方声明中表示:“即便需求持续高涨,我们仍能满足绝大多数内外部客户的算力需求。我们始终协同内部团队保障其算力供给,同时督促团队高效使用EC2资源,该管理方针从未改变。” 亚马逊称,内部工程师优化资源的准则与面向外部客户的建议完全一致:例如关停闲置云实例、切换适配自身业务负载的实例规格。若客户当前实例的算力未充分利用,可更换配置更低的机型。 AWS给出明确优化标准:若某台EC2服务器连续四周CPU、内存平均使用率不足40%,建议客户降级更换更小规格实例。 AWS配套提供自动化扫描工具,可自动识别利用率偏低的服务器。亚马逊强调,即便当前内存芯片紧缺,面向内部员工的资源管控标准并未调整。 近两年来,平衡内部研发算力与外部客户算力供给,成为各大科技巨头共同的难题。去年谷歌成立高管专项委员会,统筹分配谷歌云、DeepMind人工智能实验室、C端业务三大板块的算力资源,但各方算力争夺矛盾依旧突出。据报道,今夏谷歌顶尖AI研究员诺姆・沙泽尔便因算力资源受限、研发受阻离职。 企业若能精细化管控算力资源,就能更快将闲置算力转化为营收。微软首席财务官艾米・胡德在上月最新财报电话会上表示,Azure云服务业绩增长,部分得益于团队对CPU、GPU算力集群的高效调度优化。 胡德称:“本季度工程团队在算力盘活上成效显著;受供需失衡大环境影响,只要我们提升算力使用效率,新增的可用资源就能快速变现创收。” 一名AWS行业咨询顾问表示,客户通过合约锁定的预留CPU算力暂未出现供给缺口,但近几个月大批量申领AWS竞价实例(厂商闲置富余算力,低价售卖、可提前两分钟回收资源)的难度明显上升。

查看原文