硬盘不只存文件,95后清华博士团队让它读懂AI

关注
当Agent让模型、上下文和记忆在显存、内存与SSD之间持续流动,寅谱试图从AI计算出发,反向定义下一代存储和推理芯片。
作者|薛皓皓编辑丨关雎图源|寅谱

自ChatGPT问世以来,英伟达的股价涨了十多倍,成为全球股市的“当红炸子鸡”。底层逻辑是只要AI越强大,GPU的需求量就越大。可是现在,AI不再是GPU的独角戏。

以Coding Agent为代表的Agent兴起后,AI还要规划任务、调用工具、读取文件、检索知识、召回记忆,并在长上下文中连续工作。

这让一台计算机里的更多元件被激活:GPU负责大模型计算,CPU承担任务编排和工具调用,内存保存频繁访问的数据,SSD(固态硬盘)则要容纳模型参数、上下文缓存、知识库,甚至是智能体记忆。

当AI大模型的参数规模从千亿级迈向万亿级,当显存和内存愈发“贵如黄金”(如今内存价格已较去年第四季度上涨3~4倍),当Agent运行所需的上下文数据持续膨胀,继续依赖“暴力堆叠”GPU和内存,不仅会推高成本,也难以真正解决AI Agent规模化运行的性价比问题。

寅谱试图用一种“以存换算”的思路破题:不是让硬盘SSD替代GPU计算,而是用更低成本的SSD承接温冷(指访问频率极低和中等)的AI大模型数据、复用已经完成的中间结果,减少显存及内存压力、GPU等待和重复Prefill(预填充)。

他们正在与SSD控制器厂商联芸科技(688449.SH)合作,把一块传统上用于保存文件的硬盘,改造成能够参与模型数据调度的AI SSD。

这背后并不是给硬盘贴一个“AI”标签,而是从模型运行和系统软件出发,重新决定数据应该放在哪里、什么时候搬运,以及哪些工作最终值得被写进芯片。

除了最新发布的AI SSD外,寅谱还在布局近存的计算协处理器和推理专用ASIC芯片。

为何一家初创公司需要布局多品类的半导体芯片?

创始人田洋认为,寅谱是一家半导体和集成电路公司,公司从AI推理的真实负载和数据流出发,以软件需求指导硬件架构,并通过软硬件协同设计,将模型与系统层的需求落实到芯片、控制器、固件和存储介质的设计之中。


图片首席科学家欧阳苇航(左)、CEO田洋(中)、 CTO熊巍

从系统层面出发,让硬盘参与AI计算

寅谱成立于2024年。CEO田洋拥有清华大学计算神经科学和统计物理博士背景,CTO熊巍也是清华博士,长期研究高性能计算与AI for Science,对I/O(输入/输出)优化、负载均衡及芯片软件生态有着深入理解。两人都是95后。

他们都曾在华为2012实验室工作,这段共同经历让两人进一步从系统层面理解计算机。一块主板上存在电压、频率、温度、功耗等大量参数,不同芯片之间也会相互影响。如果能够实时理解并协同控制这些状态,就有机会在相同硬件条件下获得更好的性能与能效。

寅谱早期推出的KLEENE主板智控技术,正是这一思路的产物。

传统主板通常依据出厂前设定的静态规则管理电压、频率、功耗和散热,KLEENE则通过实时感知系统运行状态,对不同部件进行动态调节,使硬件性能得到更加稳定、充分的释放。此后,寅谱推出了基于AMD Ryzen AI Max+ 395的桌面计算机Hilbert,将其作为验证新技术和软硬件协同能力的“试验场”:主板调控、存储分层和推理软件等技术可以先在自有平台上协同运行并持续迭代,再沉淀为参考设计和标准化部件。

而在自有平台上反复验证AI推理后,团队看到的关键路径越来越清晰:无论模型参数从显存下沉到内存,还是KV Cache从内存写入SSD,数据都要经过PCIe总线。

于是,寅谱开始沿着这条总线寻找瓶颈——“AI的瓶颈已经不只是算力,存储也在成为新的关键制约。”田洋说:“AI硬件需要解决的,已经不只是能不能算,而是如何让不同层级的存储在正确时间接力,让计算尽可能少地等待。”

寅谱推出AI SSD的契机之一,正是为了尝试解决这一问题。


图片

寅谱的AI SSD,非实物图(图片来自互联网)

普通SSD面对的是一连串读写请求。它不知道某一块数据属于模型权重、MoE专家还是KV Cache,也不知道模型下一毫秒要计算哪一层。“SSD并不理解这些数据的区别,而是统一当做文件来处理。”熊巍说。

寅谱于今年6月推出的AI SSD,首先仍然是一块兼容现有计算机的SSD,但它增加了面向大模型的数据管理能力:通过专门的加速分区、固件和调度算法,参与模型权重、KV Cache和MoE专家的分层、预取与搬运。

这进一步优化了大语言模型的计算效率,而且使本地可部署的AI模型的参数规模也得到了进一步提升。

这并不意味着SSD取代了显存。更合理的关系是:最热、马上要计算的数据留在显存;近期可能使用的数据放在内存;容量更大、暂时不活跃但仍可能复用的数据进入AI SSD。上层软件负责判断“谁该去哪”,主控和固件负责高效执行。

根据寅谱透露,公司正与联芸科技等SSD控制器及产业链厂商合作,围绕大模型推理、Runtime、操作系统与SSD主控、固件、NAND Flash及模组量产适配等环节进行协同探索。

“真正要解决的问题,是如何把主机侧真实的AI工作负载需求一路传递到中间件、固件、控制器乃至NAND介质管理,让SSD围绕AI负载进行协同优化。”熊巍说。

对普通用户而言,AI SSD最直观的价值,是利用成本相对更低的SSD容量,缓解AI大模型运行对昂贵内存扩容的依赖。在特定模型、量化方法和软件栈下,普通消费级计算机通过内存与AI SSD协同,有机会运行原本需要更高硬件配置才能承载的大模型及Coding Agent任务。

沿着PCIe总线,反向定义专用计算芯片

如今,人与AI的交互,正从Chatbot的Q&A模式走向Agent模式。

过去围绕训练搭建的计算集群,并不能完全适应大模型推理的计算特性。“Agent时代的硬件竞争正从比拼单点性能,转向计算与存储协同工作的系统能力。”熊巍说。

AI SSD并不是寅谱目前主要攻克的“山头”,顺着PCIe总线,公司还在研发另一类的芯片——计算协处理器和计算ASIC。

考虑到现有产品和商业体系难以消除的I/O瓶颈,公司正通过新的协处理器和专用芯片直接解决这一瓶颈。

田洋表示:“我们按照的是软件指导硬件设计的思路。先弄清楚模型和Runtime真正需要什么,再决定硬件应该长成什么样,把稳定、重复、值得加速的能力逐步固化到硬件甚至电路里。”

寅谱正在布局近存计算协处理器及更专用的推理ASIC。与追求兼容所有任务的通用芯片不同,这类芯片会放弃一部分通用性,把大模型推理中计算密度高、结构相对固定的环节直接硬化,目标是在有限成本和功耗下支持更大规模的模型。

AI SSD与专用推理芯片因此不是两条彼此分离的产品线。前者解决数据放在哪里、如何及时到达;后者解决如何用更适合推理的方式完成计算。两者共同服务于同一件事:让一台设备用更低成本持续且高效的生成真正可用的Token。

在DDR和HBM成本仍然较高、模型持续演进的阶段,寅谱首先通过调度和协同,让现有CPU、GPU、内存与SSD发挥更大效能。正如田洋所说,这些虽然是已有的部件,但可以通过不同的组合与设计,实现不一样的效果。与此同时,寅谱也在推进专用芯片,将软硬件协同能力进一步落实到芯片设计之中。

寅谱的产品路线图也反映了公司的定位。“我们是一家集成电路与芯片设计公司。我们从大模型推理中的真实负载、数据流和使用场景出发,先判断模型、Runtime和操作系统到底需要什么,再把这些需求逐层落实到硬件的设计与适配中。最终要解决的,是让软硬件真正协同起来,把有限的算力和存储资源用得更充分。”田洋说。


竞对表格模板_Sheet2(2).png

关于未来,AI计算是“云边端”协同的——将分布在云端、边缘节点和个人设备之间,由系统根据成本、时延、隐私和数据位置灵活调度。“无论计算发生在哪里,核心都绕不开两个问题:一是降低计算成本,二是让敏感数据尽可能掌握在用户自己手中。”熊巍说。

本文为创业邦原创,未经授权不得转载,否则创业邦将保留向其追究法律责任的权利。如需转载或有任何疑问,请联系editor@cyzone.cn。

反馈
联系我们
推荐订阅