用户想用的模型,往往已经超出手机或笔记本能稳定运行的范围。
模型参数增加,权重会占用更多内存。上下文拉长后,模型还要为更多历史 Token 保留推理状态。权重和状态可能一起挤满设备内存;即使装得下,内存带宽和持续功耗预算也可能把生成速度压到难以接受。
目标路径与验证边界
模型参数增加,权重会占用更多内存。上下文拉长后,模型还要为更多历史 Token 保留推理状态。权重和状态可能一起挤满设备内存;即使装得下,内存带宽和持续功耗预算也可能把生成速度压到难以接受。
推理执行方可读Prompt、历史对话和相关资料到达服务端后,必须成为模型能够读取和计算的状态。HTTPS 保护传输过程,不能阻止推理执行方读取正在计算的内容。
精确推理 · 非单点状态Fusion Compute 检查状态由哪些节点持有,以及后继算子能否直接读取 shard 继续计算。把同一份状态换一种编码后交给单个服务方,并不会改变它能否读取完整状态。
TEXT → NUMERIC STATETokenizer 把文本转成 Token ID(词元编号),模型再映射出 embedding 和逐层更新的 hidden state。这是表示转换,不是哈希或加密;数字仍然承载输入信息。
HISTORY · CURRENT STATEKV Cache 是历史 Token 的 key/value 记忆;hidden state 是当前 Token 正在向下一层传递的计算状态。实验要检查两类状态能否保持分片,并被后继算子直接读取,而不在受审计区间内恢复完整状态。
TOPOLOGY → SHARDS拓扑规则规定哪些节点参与、每个节点持有什么。参与方可以来自不同计算供应商,但跨供应商执行仍是目标;当前实验只覆盖同一 Pod 的两张 L4。
LOCAL → REDUCESCATTER → SHARDReduceScatter 负责归约局部贡献,并把每段结果发给负责持有该输出 shard 的节点。审计检查受审计区间内是否出现完整 Tensor 重建;当前结果不能说明单个 shard 无法泄露输入信息。
LOCAL → DISTRIBUTED → LOCAL推理的起点和终点留在用户可控的一侧,外部节点只参与中间计算。当前实验尚未验证端到端本地编码、用户侧汇合或解码。

2× L4 · 250/250分片状态经过 Attention、SwiGLU MLP(门控非线性)和两次 residual add(把结果加回当前状态),随后被下一层真实 Q/K/V 投影读取;250/250 个受审计 step 都满足上述条件。受审计区间内没有隐藏 AllGather。这只支持:在已验证边界内,完整状态并非单点执行的必要条件。验证边界之后显式执行兼容性 AllGather。
LAYER · RANK · DEPLOYMENT端到端输入、KV Cache 全生命周期、用户侧重建、Secret Sharing、TEE、MPC、恶意 worker 和节点合谋也都尚未验证。当前结构证据不等于完整隐私产品。
继续阅读
完整技术说明列出当前实验的算子路径、审计区间和证据尚未覆盖的部分。