“后发先至”的火山引擎：豆包大模型卷完价格卷性能

发布时间：2024-09-25 18:48:03 来源：网络作者：admin

　　“豆包大模型日均Tokens调用量超过1.3万亿，文生图模型日均生成图片5000万张，日均处理语音85万⼩时——这个数字相当于7万天的广播节目播出时⻓的总和。”9月24日，2024火山引擎AI创新巡展深圳站上，火山引擎总裁谭待公布了豆包大模型最新“战绩”。

　　当天，火山引擎发布了豆包视频生成-PixelDance、豆包视频生成-Seaweed两款大模型，活动现场展示的视频生成效果令人惊叹。同时，火山引擎还推出了豆包音乐模型和同声传译模型，至此，其已全面覆盖语言、语音、图像、视频等全模态，全方位满足不同行业和领域的业务场景需求。

　　大模型降价潮引发创新应用“涌现”

　　豆包是字节跳动推出的自研大模型，是国内首批通过算法备案的大模型之一。在各家大模型竞赛中，豆包虽然不是上线最早的，但在各个维度都保持了国内领先地位。根据商业智能数据服务商QuestMobile报告显示，基于豆包大模型打造的豆包App在同类产品中优势显著，月活用户数在上半年已达到2752万，是第二名的2.43倍。

　　效果不好、成本太贵、落地太难是大模型在业务场景落地中的关键挑战，而在企业应用场景里，挑战会更加复杂。谭待表示，“（在企业应用场景中）我们不仅仅要考虑模型能力，还要考虑成本、性能、安全和易用性。”

　　在自然语言处理领域，“token”代表文本中最小的语义单元。按已有惯例，大约1—1.8个汉字等于1个token，而在英文文本中约是3—4个字母。在商业计算中，千tokens是大模型主要计费单元。

　　今年5月，火山引擎在国内第一个把模型成本做到每千token低于一厘钱，豆包主力模型在企业市场的定价只有0.0008元/千tokens，0.8厘就能处理1500多个汉字，比行业便宜99.3%。

　　豆包大模型的超低价格引发行业震动，对此，谭待表示，“在这样大幅的降价背后，大量的创新应用随之不断涌现。其他厂商也在跟随我们的步伐，不断把模型进行降价，大家共同努力让应用生态更加繁荣。”

　　谭待坦言，“Tokens价格已经不再是妨碍创新的阻力了。反过来，随着应用的不断增多，模型性能又成为应用上量的关键。”为此，豆包Pro默认支持高达800K的初始TPM（每分钟处理Tokens数量），这个数字远超行业最好水平，在初始800K的基础上，还可以根据企业需求进一步扩容。

　　此外，豆包Pro的上下⽂窗⼝也进行了升级。原来豆包Pro 4K版本将直接升级到32K，同时对长文本的128K窗口也进行升级，直接翻倍，现在豆包最长支持256K窗口。“最新升级的窗口，能同时处理约40万汉字，相当于一口气把《三体》第一部和第二部全部读一遍，而且所有升级加量不加价。”

　　“在我们努力下，大模型的应用成本已经得到很好解决。大模型要从卷价格走向卷性能，卷更好的模型能力和服务。”谭待表示。

　　豆包视频生成模型破解多个行业难题

　　豆包视频生成模型是当天的“重头戏”。此前，视频生成模型大多只能完成简单指令，而豆包视频生成模型则能“指哪儿打哪儿”，实现自然连贯的多拍动作与多主体复杂交互。

　　比如，如何10秒讲述一个起承转合的故事？豆包视频生成模型全新设计的扩散模型训练方法，攻克了多镜头切换时难以保持一致性的困扰，在一个prompt的多个镜头切换时，保持主体、风格、氛围和逻辑的一致性。

　　如何告别PPT动画？豆包视频生成模型通过高效的DiT融合计算单元，让视频在大动态与运镜中自由切换，拥有变焦、环绕、平摇、缩放、目标跟随等多镜头语言能力。

　　如何实现电影级的画面？通过专业级色彩调和和光影布局，豆包视频生成模型大幅提升画面视觉审美。同时，深度优化的Transformer结构，大幅提升了视频生成的泛化能力，支持多种视频风格及画面比例。

　　得益于抖音和剪映对视频日积月累的理解，反过来，模型的出现又能为视频的创作带来巨大的提升。现场，即梦AI及剪映市场和运营负责人陈欣然介绍了一个针对电商商家的“内容营销”创作神器。用户只要填写商品名、上传素材或者粘贴商品页链接，就能一键生成多个不同风格的带货视频。

　　“过去，商家可能要花几个小时刷抖音和TikTok分析爆款带货视频套路，拆解套路、仿写文案，还要花几个小时剪辑，现在整个过程只需几分钟。”陈欣然说。

上一篇：科普中国直播预告|2024年全国科普日铁科院专项活动暨第二届“铁科星空讲坛”
下一篇：WPS 365参与打造新一代AI Native办公门户“绿舟”