今年早些时候,谷歌AI负责人杰夫·迪恩在一个播客中讨论了一个在当时科技圈以外几乎无人谈论的概念:蒸馏。 在谈论谷歌AI模型的开发时,迪恩表示,他和同事们发现了AI蒸馏技术,因为谷歌希望在无需依赖单一大型图像识别模型的情况下提升系统性能。 “通过蒸馏——这是让较小模型能力更强的关键技术——你必须先有前沿模型,然后才能将其蒸馏进你的较小模型中,”迪恩在二月份表示。 五个月后,蒸馏突然成为从硅谷到华盛顿的热门话题,科技界人士和立法者正在争论这种做法是否正在变成国家安全威胁。 从高层次来看,蒸馏指的是利用聊天机器人的答案或先进AI模型的产出成果来训练另一个模型。这种做法存在争议,因为根据使用方式的不同,它可以让模型开发者仅通过使用那些投资了数百万或数十亿美元开发最先进训练技术的公司的产出,就能创建出具有竞争力的产品。 “这几乎就像有人去听了讲座,读了教科书,并完成了所有艰难的功课,”AI安全公司SecurityPal的创始人普卡尔·哈马尔说。“然后另一个学生说:‘嘿,我没做那些。我能直接抄你的作业吗?’” 不论是因为克拉齐奥斯的帖子还是其他原因,全球最大的几家科技巨头于周五以前所未有的方式联合起来,明确表态。经过一周的一系列社交媒体帖子后,科技巨头英伟达、微软、Meta、Palantir与其他20多家公司联合发布了一封联名信,敦促政策制定者避免对开放权重AI模型实施“过早限制”,以免“扼杀竞争或将创新推向海外”。 “蒸馏,即使用一个模型的输出来帮助训练或改进另一个模型的做法,是用于模型改进、演进和验证的广泛使用的技术,”他们写道。 蒸馏的出现给美国政策制定者出了一个难题。 Box公司首席执行官亚伦·列维是周五联名信的签署人之一。列维在接受采访时表示,为了保持竞争力,美国公司需要能够获取最好的技术,无论它是在哪里开发的。 “总体趋势将是,创新越多——无论是来自美国还是其他地方——你就应该期待更多的AI进步,而且总体上会随着时间的推移朝着成本更低、效率更高的方向发展,”列维说。 Info-Tech研究集团的研究总监沙希·贝拉姆孔达表示,尽管当前许多讨论都集中开放权重AI模型上,但许多公司在创建自己的模型时也纳入了蒸馏技术。例如,英伟达在其Llama Nemotron系列模型的训练过程中就使用了蒸馏,相关研究论文中有详细描述。 “这是一种合法且非常有价值的技术,用于基于较大模型的输出来训练更小、更便宜的模型,并且一直被广泛使用,”贝拉姆孔达说。 然而,Anthropic持有不同观点,因为该公司看到了其模型的使用方式,并且有蓬勃发展的业务需要保护。 Anthropic估值接近1万亿美元,并有意在不久的将来上市。该公司表示,阻止非法蒸馏事关国家安全。 “Anthropic和其他美国公司构建了系统,以防止国家和非国家行为者利用AI,例如开发生物武器或进行恶意网络活动,”该公司在二月份的帖子中表示。而阻止它需要“行业参与者、政策制定者和全球AI社区之间迅速、协调的行动”。 OpenAI和Anthropic在其服务条款中禁止蒸馏。贝拉姆孔达表示,它们实质上是在暗示,未经授权使用它们的大型模型代表了潜在的知识产权盗窃。 但随着AI成本飙升,公司将竭尽全力提高效率。 哈马尔表示,在SecurityPal公司,他不反对使用开放权重模型,该公司使用AI自动化安全评估。他说这可以为他们节省大量资金。 “我们会确保代码中没有恶意的后门,”哈马尔说。“但在我们完成评估后,将其托管在我们自己的基础设施上,何乐而不为呢?” Anthropic和OpenAI在试图论证知识产权盗窃问题时面临的一个大问题是,这两家公司都依赖其他来源的内容来构建自己的模型,并因此被起诉。 Boies Schiller Flexner律师事务所的律师马克斯·普里特,在针对AI公司的版权诉讼中代表书籍作者。他表示,政府也处于同样的境地。 “至少公开地,本届政府将其工作重点放在保护科技公司的知识产权上,而在很大程度上对创作者和个人的知识产权在未经授权的情况下被使用保持沉默,”普里特说。
宏观
从硅谷到华盛顿,科技界突然痴迷于AI中的一个概念:蒸馏
今年早些时候,谷歌AI负责人杰夫·迪恩在一个播客中讨论了一个在当时科技圈以外几乎无人谈论的概念:蒸馏。 在谈论谷歌AI模型的开发时,迪恩表示,他和同事们发现了AI蒸馏技术,因为谷歌希望在无需依赖单一大型图像识别模型的情况下提升系统性能。 “通过蒸馏——这是让较小模型能力更强的关键技术——你必须先有前沿模型,然后才能将其蒸馏进你的较小模型中,”迪恩在二月份表示...