AI 推理提速竞争正在升温。法国初创公司 Kog 没有选择自研芯片,而是押注通过底层软件优化,进一步释放企业现有数据中心 GPU 的推理能力。
先瞄准企业高时延场景
这家公司在今年 5 月因一项技术预览受到关注。Kog 当时展示,使用 AMD MI300X 和 Nvidia H200 等标准数据中心 GPU,也能实现极快的单请求解码速度。公司随后称,这一展示带来了约 200 个明确的商业线索。
Kog 目前优先关注对响应速度要求较高的专业工作流,尤其是软件工程场景。按照公司说法,一些重度代码生成用户等待结果的时间可能长达数小时,推理延迟已成为影响使用体验和成本的重要问题。
公司还在与部分设计合作伙伴推进应用落地。这类客户允许用户通过提示词生成游戏或应用,若推理速度提升,通常意味着更高的转化效率和收入空间。
小模型已跑出 3000 TPS
Kog 此前提出“让大模型推理提速 30 倍”的目标,但目前公开演示仍主要基于小模型。其展示使用的是约 20 亿参数的 Laneformer 2B,单请求推理速度达到每秒 3000 个 token。该模型现已开源。
不过,市场需求并未停留在小模型微调。Kog 表示,潜在客户并不准备把重点放在小模型上,因此公司自发布演示后,已将主要精力转向更大模型的加速开发,以匹配实际需求。
9 月前后验证大模型能力
Kog 认为,GPU 在推理解码上的潜力仍未被完全释放。公司首席执行官 Gaël Delalleau 表示,随着新一代 GPU 内存带宽持续提升,软件层仍有较大优化空间。
这种方法的代价是研发周期较长。Kog 表示,每适配一款新 GPU,团队往往需要投入数周甚至数月做硬件层面的研究。以目前 11 人团队规模来看,公司短期内可支持的芯片数量仍然有限。
Kog 计划未来把这套方法逐步接入基于智能体的研发流程,以支持更多芯片和模型。眼下更关键的节点,是先证明这一路线能在大模型上成立。Delalleau 预计,公司将在 9 月前后完成首个主要模型约 10 倍提速的实现,并据此展示客户进展,推动后续 A 轮融资。