大型语言模型中最大的瓶颈：速率限制

时间：2024-01-19 12:44:59 来源：51CTO技术栈作者：

作者 | Matt Asay

策划 | 言征

出品 | 51CTO技术栈（微信号：blog51cto）

速率限制意味着每个人都在等待更好的计算资源或不同的生成人工智能模型。

大型语言模型（LLM），如AI target=_blank class=infotextkey>OpenAI的GPT-4和Anthropic的Claude 2，凭借其生成类人文本的能力，吸引了公众的想象力。企业也同样热情高涨，许多企业正在探索如何利用LLM来改进产品和服务。然而，一个主要瓶颈严重制约了在生产环境中采用最先进的LLM：速率限制。有一些方法可以通过这些费率限制收费站，但如果没有计算资源的改进，真正的进展可能不会到来。

1、为瓶颈付出的代价

允许访问OpenAI和Anthropic等公司模型的公共LLM API对每分钟可处理的令牌（文本单位）数量、每分钟的请求数量和每天的请求数量施加了严格限制。

例如，这句话将消耗九个标记。目前，对OpenAI GPT-4的API调用限制为每分钟三个请求（RPM）、每天200个请求和每分钟最多10000个令牌（TPM）。

最高级别允许10000 RPM和300000 TPM的限制。对于每分钟需要处理数百万个代币的大型生产应用程序，这些速率限制使得使用最先进的LLM基本上不可行。请求堆积起来，需要几分钟或几个小时，无法进行任何实时处理。

大多数企业仍在努力在规模上安全有效地采用LLM。但是，即使他们在应对数据敏感度和内部流程方面的挑战时，速率限制也是一个顽固的障碍。当产品使用量和数据积累时，围绕LLM构建产品的初创企业很快就会达到峰值，但拥有庞大用户基础的大型企业受到的限制最大。如果没有特殊访问权限，他们的应用程序将根本无法工作。

怎么办？

2、绕过速率限制

一种方法是完全跳过速率限制技术。例如，有一些特定用途的生成人工智能模型没有LLM瓶颈。Diffblue是一家总部位于英国牛津的初创公司，它依赖于不受费率限制的强化学习技术。它做一件事非常好，非常高效，可以覆盖数百万行代码。

它以开发人员250倍的速度自主创建JAVA单元测试，编译速度快10倍。Diffblue Cover编写的单元测试能够快速理解复杂的应用程序，使企业和初创公司都能满怀信心地进行创新，例如，这是将传统应用程序转移到云的理想选择。它还可以自主编写新代码，改进现有代码，加速CI/CD管道，并在不需要手动审查的情况下深入了解与更改相关的风险。还不错。

当然，有些公司不得不依赖LLM。他们有什么选择？

3、请多加计算

一种选择是简单地要求提高公司的利率限制。到目前为止，这还可以，但潜在的问题是，许多LLM提供商实际上没有额外的能力提供服务。这就是问题的症结所在。GPU的可用性取决于从台积电等铸造厂开始的总硅片数量。占主导地位的GPU制造商英伟达无法采购足够的芯片来满足人工智能工作负载驱动的爆炸性需求，大规模推理需要数千个GPU聚集在一起。

增加GPU供应的最直接方法是建造新的半导体制造厂，即晶圆厂。但一个新的晶圆厂成本高达200亿美元，需要数年时间才能建成。英特尔、三星铸造、台积电和德州仪器等主要芯片制造商正在美国建造新的半导体生产设施。总有一天，那会很棒。现在，每个人都必须等待。

因此，利用GPT-4的实际生产部署很少。这样做的范围不大，将LLM用于辅助功能，而不是作为核心产品组件。大多数公司仍在评估试点和概念验证。在考虑费率限制之前，将LLM集成到企业工作流程中所需的提升本身就相当大。

4、寻找答案

限制GPT-4吞吐量的GPU限制促使许多公司使用其他生成人工智能模型。例如，AWS有自己的专门芯片用于训练和推理（训练后运行模型），使其客户具有更大的灵活性。重要的是，并不是每个问题都需要最强大、最昂贵的计算资源。AWS提供了一系列更便宜、更容易微调的型号，如Titan Light。

一些公司正在探索其他选择，比如微调开源模型，比如Meta的Llama 2。对于涉及检索增强生成（RAG）的简单用例，需要将上下文附加到提示并生成响应，功能较弱的模型就足够了。

跨多个具有更高限制的旧LLM并行请求、数据分块和模型提取等技术也会有所帮助。有几种技术可以使推理更便宜、更快。量化降低了模型中权重的精度，这些权重通常是32位浮点数字。这不是一种新方法。例如，谷歌的推理硬件张量处理单元（TPU）仅适用于权重已量化为八位整数的模型。该模型失去了一些准确性，但变得更小，运行速度更快。一种名为“稀疏模型”的新流行技术可以降低训练和推理的成本，而且它比蒸馏技术劳动密集度更低。您可以将LLM视为许多较小语言模型的集合。例如，当你用法语问GPT-4一个问题时，只需要使用模型的法语处理部分，这就是稀疏模型所利用的。

你可以进行稀疏训练，只需要用法语训练模型的一个子集，也可以进行稀疏推理，只运行模型的法语部分。当与量化一起使用时，这可以是一种从LLM中提取较小专用模型的方法，LLM可以在CPU而不是GPU上运行（尽管精度损失很小）。问题是什么？GPT-4之所以出名，是因为它是一个通用的文本生成器，而不是一个更窄、更具体的模型。

在硬件方面，专门用于人工智能工作负载的新处理器架构有望提高效率。Cerebras已经构建了一个为机器学习优化的巨大晶圆级引擎，Manticore正在重新利用制造商丢弃的“被拒绝的”GPU硅来提供可用的芯片。最终，最大的收益将来自于需要更少计算的下一代LLM。结合优化的硬件，未来的LLM可以突破今天的速率限制障碍。

目前，生态系统在渴望利用LLM力量的公司的压力下变得紧张。那些希望在人工智能方面开辟新天地的人可能需要等到GPU供应在未来漫长的道路上进一步开放。具有讽刺意味的是，这些限制可能有助于缓和围绕生成性人工智能的一些泡沫炒作，让行业有时间适应积极的模式，高效、经济地使用它。

参考链接：https://www.infoworld.com/article/3712300/the-biggest-bottleneck-in-a-large-language-model.html

Tags：大型语言模型点击:() 评论:()

声明：本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,不构成投资建议。投资者据此操作，风险自担。如有任何标注错误或版权侵犯请与我们联系，我们将及时更正、删除。

▌相关推荐

简易百科之什么是大型语言模型？

简易百科之什么是大型语言模型？随着人工智能技术的不断发展，语言模型在自然语言处理领域的应用越来越广泛。大型语言模型作为其中的一种重要类型，受到了广泛的关注和研究。那么...【详细内容】

2024-01-26　　Search: 大型语言模型点击:(158)　　评论:(0)　　加入收藏

大型语言模型中最大的瓶颈：速率限制

作者 | Matt Asay策划 | 言征出品 | 51CTO技术栈（微信号：blog51cto）速率限制意味着每个人都在等待更好的计算资源或不同的生成人工智能模型。大型语言模型（LLM），如OpenAI的GPT-4...【详细内容】

2024-01-19　　Search: 大型语言模型点击:(50)　　评论:(0)　　加入收藏

一文读懂大型语言模型LLM

在当今的技术世界中，人工智能正以前所未有的速度发展和演变。这一领域的快速发展得益于先进的机器学习算法、海量数据的可用性以及计算能力的显著提升。特别是，在自然语言处理...【详细内容】

2024-01-02　　Search: 大型语言模型点击:(81)　　评论:(0)　　加入收藏

一文带你解密 Large Language Model（大型语言模型）

Hello folks，我是 Luga，今天我们来聊一下人工智能（AI）生态领域相关的技术 - Large Language Model（大型语言模型）。在过去十年间，AI（人工智能）领域取得了令人瞩目的突破，而其中的 NLP...【详细内容】

2023-11-14　　Search: 大型语言模型点击:(282)　　评论:(0)　　加入收藏

什么是 LLM （大型语言模型）以及如何构建LLM？

来源：Mangesh Gothankar在本文中，我们将了解如何从零开始构建 LLM（大型语言模型）。你可能会问，为什么要做这样的事情？是这样的，LLM 在无数应用中都非常有用，从头开始构建一个 LLM，你...【详细内容】

2023-11-09　　Search: 大型语言模型点击:(90)　　评论:(0)　　加入收藏

大型语言模型（LLM）技术精要，不看亏了

今天分享一篇知乎高赞文章，作者是张俊林老师。图片读完收获很多，能帮大家更好地理解、学习大模型。原文有2.8w字，我提炼了核心要点，阅读需要10min。ChatGPT的出现给很多人带来了...【详细内容】

2023-11-06　　Search: 大型语言模型点击:(223)　　评论:(0)　　加入收藏

大型语言模型的零样本性能

近年来，随着人工智能技术的高速发展，大型语言模型成为了自然语言处理领域的一项重要突破。然而，对于这些模型来说，如何在未接触过的问题上表现出可靠的零样本性能一直是一个挑战...【详细内容】

2023-10-10　　Search: 大型语言模型点击:(285)　　评论:(0)　　加入收藏

大型语言模型和人工智能代码生成器的兴起

译者 | 李睿本文作者Martin Heller是一名Web和Windows编程顾问，也是行业媒体InfoWorld的特约编辑和评论员。Heller表示，他在2021年11月撰写关于GitHub Copilot的文章时，Copilot...【详细内容】

2023-08-04　　Search: 大型语言模型点击:(164)　　评论:(0)　　加入收藏

非ChatGPT的14个大型语言模型

译者 | 李睿如今，很多企业高管都将人工智能视为未来发展方向，许多技术领导者也将ChatGPT视为人工智能的代名词。但是OpenAI的旗舰产品ChatGPT并不是唯一的大型语言模型—...【详细内容】

2023-07-10　　Search: 大型语言模型点击:(197)　　评论:(0)　　加入收藏

如何训练自己的大型语言模型

本文将介绍Replit如何利用Databricks、Hugging Face和MosaicML训练大型语言模型(LLMs)。Replit是美国一家编码平台,提供了一个可从浏览器访问的IDE,无需设置即可开始编码,此...【详细内容】

2023-04-27　　Search: 大型语言模型点击:(273)　　评论:(0)　　加入收藏

▌简易百科推荐

多方热议人工智能产业新机遇

编者按&emsp;&emsp;从前沿科技展会到高层对话平台，从上海、重庆到博鳌，从线上到线下……一场场高规格、大规模的盛会中，人工智能正在成为各界热议的高频词。赋能千...【详细内容】

2024-04-08　　　　中国家电网　　Tags:人工智能　点击:(3)　　评论:(0)　　加入收藏

人形机器人时代来了吗

日前，由中国人形机器人(11.080, -0.05, -0.45%)百人会主办的人形机器人大赛在北京经济技术开发区开赛。工作人员向参观者展示一款人形机器人。参观者与一款陪护型人形机器人...【详细内容】

2024-04-08　　　　中国青年报　　Tags:人形机器人　点击:(3)　　评论:(0)　　加入收藏

AI重塑社交：腾讯与字节跳动的新赛场

文|新火种一号编辑|美美最近，腾讯和字节跳动这两大互联网巨头几乎同步推出了各自的AI社交产品，尽管腾讯和字节跳动在前段时间刚刚“破冰”，但这一举措不仅意味着这两大巨头之...【详细内容】

2024-04-07　　　　蓝鲸财经　　Tags:AI 　点击:(6)　　评论:(0)　　加入收藏

第一批用 Kimi 做内容的网红已经杀疯了

作者：王东东文章来自：斗战圣佛小组技术信仰派 VS 市场信仰派朱啸虎和月之暗面老板杨植麟在前几天有一场不算 battle 的 battle。battle 的争论点是：大模型有没有戏。技术派...【详细内容】

2024-04-04　　　　斗战圣佛小组　　Tags:Kimi 　点击:(4)　　评论:(0)　　加入收藏

昆仑万维发布面向人工智能时代的六条人才宣言

过去的一年多，是人工智能取得非凡进步的一年。在这充满突破性技术飞跃和备受争议的一年里，我们见证了人工智能的快速发展和广泛的影响，人工智能已经迅速地融入了我们的生活，深刻...【详细内容】

2024-04-03　　　　砍柴网　　Tags:昆仑万维　点击:(7)　　评论:(0)　　加入收藏

AI干掉声优？音频大模型追逐“图灵时刻”

七十年前，“人工智能之父”图灵提出，如果人无法判断屏幕的另一侧究竟是人还是机器，就证明机器具备了人一样的智能。这一经典的图灵测试如同北斗星一般，指引着AI行业的工作者们不...【详细内容】

2024-04-03　　　　第一财经网　　Tags:AI 　点击:(5)　　评论:(0)　　加入收藏

生成式人工智能有哪些新趋势？

相较于去年，当下我们所能体验的人工智能技术的范围已经大幅提升。从搜索引擎、电商平台再到社媒平台，只要是以搜索结果为导向的内容，都会出现它的身影。但其实，人工智能的应用场...【详细内容】

2024-04-03　　品谈教师帮　　　　Tags:人工智能　点击:(6)　　评论:(0)　　加入收藏

AI世界的新难题：互联网的信息不够用了！

高质量数据的紧缺正成为AI发展的重要障碍。4月1日，据媒体报道，随着OpenAI、Google等企业不断深入发展AI技术，科技巨头们遇到了一个新问题：现有的互联网信息量可能不足以支撑他们...【详细内容】

2024-04-02　　硬AI　　　　Tags:AI 　点击:(6)　　评论:(0)　　加入收藏

今天起，ChatGPT无需注册就能用了！

　来源：量子位　　　　金磊克雷西发自凹非寺　　就在刚刚，OpenAI狠狠地open了一把：从今天起，ChatGPT打开即用，无需再注册帐号和登录了！　　像这样，直接登录网站，然后就可以开启对...【详细内容】

2024-04-02　　　　量子位　　　Tags:ChatGPT 　点击:(7)　　评论:(0)　　加入收藏

AI时代，面对死亡有了第二种选择？

今年春节期间，罗佩玺瞒着妈妈用AI技术“复活”了外婆，她将妈妈现在的模样和外婆留下的老照片合成在一起。时隔60多年，妈妈和外婆终于又“见面”了，这是她送给妈妈的生日礼物。收...【详细内容】

2024-04-02　　　　中国青年报　　Tags:AI时代　点击:(7)　　评论:(0)　　加入收藏

推荐资讯

访问网站显示不安全是	掌握独立站SEO策略，提
快手蓝色小钥匙跳转微	微信朋友圈如何置顶
Facebook新用户扩展怎	详解微信里面的分期可
微信表情包更新：原创设	微信朋友圈功能大改版