翻译计算图
扩展 ggml graph 执行路径,将社区计算图编译并下发给自研 Runtime,再接回设备结果。
GRAPH → ADAPTER → RUNTIME我实现了连接两套系统的适配层,把请求、计算图、设备内存、Token 采样和流式响应串成一条真正可用的推理链路。
“请用三句话解释为什么天空看起来是蓝色的。”
正在接收问题…
请求仍由 llama.cpp Server 接收,原有的 Batch、Slot 与会话逻辑不需要推倒重来。
SERVER REQUEST使用预设问题与执行轨迹展示已完成的推理链路;本页面不执行实时芯片推理。
我具体解决了什么
扩展 ggml graph 执行路径,将社区计算图编译并下发给自研 Runtime,再接回设备结果。
GRAPH → ADAPTER → RUNTIME适配 Prefill、Decode、Sequence、UBatch、KV Cache 与 Buffer,保证每一步都使用正确上下文。
PREFILL → KV CACHE → DECODE完成 Logits 重排,并复用原有 Sampler 与 Server 流式响应,覆盖生成、Embedding 和 Rerank。
LOGITS → SAMPLE → STREAM