项目一句话LLM 推理后端适配

让 llama.cpp
在自研芯片上完整跑通。

我实现了连接两套系统的适配层,把请求、计算图、设备内存、Token 采样和流式响应串成一条真正可用的推理链路。

我的角色推理后端适配
技术栈C++ · llama.cpp · Runtime
验证范围2 模型 · 2 量化 · 8K Context
一条代表性请求,后台发生了什么?
演示就绪
用户输入

“请用三句话解释为什么天空看起来是蓝色的。”

用户最终看到的结果处理中

正在接收问题…

当前步骤 / 01

先保留用户熟悉的 llama.cpp 服务入口

请求仍由 llama.cpp Server 接收,原有的 Batch、Slot 与会话逻辑不需要推倒重来。

SERVER REQUEST
  1. 01接收请求SERVER
  2. 02整段输入PREFILL
  3. 03计算图适配ADAPTER
  4. 04芯片执行RUNTIME
  5. 05上下文缓存KV / DECODE
  6. 06采样并返回STREAM
社区原有能力我实现或改造自研芯片 Runtime

使用预设问题与执行轨迹展示已完成的推理链路;本页面不执行实时芯片推理。

我具体解决了什么

不是“接上芯片”这么简单,
而是补齐整条服务链路。

01 / 计算怎么跑

翻译计算图

扩展 ggml graph 执行路径,将社区计算图编译并下发给自研 Runtime,再接回设备结果。

GRAPH → ADAPTER → RUNTIME
02 / 上下文怎么留

管理设备内存

适配 Prefill、Decode、Sequence、UBatch、KV Cache 与 Buffer,保证每一步都使用正确上下文。

PREFILL → KV CACHE → DECODE
03 / 结果怎么回来

形成服务闭环

完成 Logits 重排,并复用原有 Sampler 与 Server 流式响应,覆盖生成、Embedding 和 Rerank。

LOGITS → SAMPLE → STREAM
99.3%输出 Token 一致率与基准后端进行端到端贪心解码对比
+22%吞吐提升相较初版自研后端
−18%首 Token 延迟相较初版自研后端
28 项 / 24H回归与稳定性覆盖完整服务链路
回到开头 ↑重新看演示 ↻下一个项目:Graph RAG →