[论文学习]Sylph:将基于FHE的隐私保护推理扩展至LLaMA-3-8B

[论文学习]Sylph:将基于FHE的隐私保护推理扩展至LLaMA-3-8B Sylph: Scaling FHE-based Privacy-Preserving Inference to LLaMA-3-8B论文重点本文提出了Sylph系统首次将全同态加密FHE推理成功扩展至LLaMA-3-8B这一参数规模的大语言模型。在8张NVIDIA RTX PRO 6000 GPU上128个加密token的摘要任务仅需20秒生成阶段每token仅需18秒——相比之下现有最先进方案在更昂贵的8张H100 GPU上需要295秒。Sylph还创新性地支持了“明文密文”异构输入模式可将提示长度扩展至数千token为FHE隐私推理的实用化迈出了关键一步。核心研究内容问题定义大语言模型LLM的云端推理带来了严重的隐私风险——用户的查询内容在传输和计算过程中可能被服务方或第三方窥探。全同态加密FHE作为一种“密文上直接计算”的加密方案被视为解决这一问题的理想工具。然而FHE推理面临两大核心障碍第一扩展性瓶颈。现有FHE推理方案要么只能处理小模型要么只能处理大模型但输入token数量极少。随着输入长度增加同态运算的复杂度和噪声增长呈指数级上升导致实际不可行。第二异常值Outliers灾难。LLM的激活值中存在大量异常大值这些值对非线性层如SiLU激活函数、SoftMax的同态评估影响极大。FHE中评估非线性函数需要多项式近似而异常值的存在迫使使用高次多项式以保证精度直接导致计算量爆炸。创新方法Sylph从两个维度展开创新维度一128加密token场景的加速异常值缓解技术采用Token Prepending前置填充和Orthogonal Rotations正交旋转两种机器学习技术将非线性计算层的数值范围从约2400压缩至40以下。对于SiLU激活函数多项式次数从83降至31计算速度提升1.55倍。稀疏打包密文的多项式评估针对SoftMax计算中密文稀疏打包的特点设计了新的多项式评估方法大幅加速同态SoftMax实现。快速同态线性代数技术结合多项最新的线性层加速方法实现了线性层的端到端效率提升。维度二数千token长提示的扩展Sylph提出了一种创新的“明文密文”异构输入框架假设上下文中只有最后一部分是敏感且加密的前面部分为明文处理这种输入需要同时处理三种计算分量明文-明文分量与全明文推理完全一致密文-密文分量与全加密推理一致明文-密文分量本框架特有的新计算模式针对明文-密文分量设计了专门的同态线性代数算法并构建了浅层同态注意力电路Shallow Homomorphic Attention Circuit以最小化Bootstrapping开销。整个系统基于CKKS同态加密方案实现端到端的Llama-3-8B私有推理。研究成果性能数据8×NVIDIA RTX PRO 6000 GPUs场景摘要Prefill生成每token128加密token20秒18秒/token4096异构token后128加密64秒22秒/token现有SOTA8×H100128 token295秒—对比分析Sylph在成本更低的RTX PRO 6000 GPU上将摘要速度提升了14.75倍295s → 20s。异构输入模式4096 token仅比全加密模式128 token多耗费44秒说明明文部分的开销被有效控制。精度保障Llama-3-8B采用20-bit Bootstrapping流程有效精度达到13-bit足以保障下游任务精度。实际落地应用的可能性Sylph的成果使得FHE隐私推理从“理论可行”走向“工程可用”医疗场景患者可将病历摘要加密输入云端LLM进行辅助诊断全程不暴露隐私金融场景财务报表、投资组合等敏感数据可在密文状态下完成智能分析法律场景涉密合同条款的智能审查无需将原文上传至服务商个人隐私保护普通用户的对话历史、个人信息在云端推理中得到加密保护异构输入模式特别适合“长上下文短敏感内容”的实际场景——例如用户想基于大量公开文档明文问一个涉及个人隐私的问题加密Sylph可以在不暴露隐私的前提下完成推理。技术细节1. 异常值缓解Token Prepending与Orthogonal RotationsLLM的激活值异常值通常集中在特定维度上。Sylph采用了两层策略Token Prepending在输入序列前添加特殊token改变激活值分布Orthogonal Rotations通过正交变换将异常值分散到更多维度两者结合后非线性计算的数值范围从**~2400降至40**降幅达98%以上。2. 同态SoftMax的稀疏打包优化FHE的CKKS方案支持将多个数值打包到一个密文中进行SIMD式运算。SoftMax计算中密文并非完全填满——Sylph利用这种稀疏性设计了专门的多项式评估方法避免了冗余计算。3. Bootstrapping精度管理Bootstrapping是FHE中重置密文噪声的关键操作也是性能瓶颈所在。Sylph采用20-bit Bootstrapping流程有效精度13-bit——在精度和性能之间找到了平衡点。4. 浅层同态注意力电路对于明文-密文混合场景Sylph设计了专用的同态线性代数算法将注意力计算拆分为明文-明文、密文-密文、明文-密文三个独立分量明文-密文分量使用定制化的同态矩阵乘法整体电路深度被刻意保持在浅层以减少Bootstrapping次数5. CKKS端到端实现Sylph基于CKKS方案构建了完整的端到端推理流水线Prefill阶段四个核心操作依次执行Decode阶段逐token自回归生成每个阶段都包含线性层矩阵乘法和非线性层SiLU、SoftMax的同态评估研究设定硬件配置GPU8×NVIDIA RTX PRO 6000对比实验中还使用了8×H100部署方式多GPU集群并行计算软件与算法同态加密方案CKKS近似同态加密目标模型Llama-3-8BBootstrapping精度20-bit流程13-bit有效精度实验场景全加密场景128个输入token全部加密异构场景4096个输入token前3968个为明文后128个为加密评估指标摘要Prefill总耗时生成Decode每token耗时综合分析为什么Sylph能实现如此大的性能跨越Sylph的成功并非单一技术的突破而是系统级协同优化的结果第一异常值管理是解锁性能的关键钥匙。现有FHE推理方案之所以在长输入上表现糟糕很大程度上是因为异常值迫使非线性层使用极高次的多项式近似。Sylph将数值范围压缩98%后多项式次数从83降至31——这不是渐进式改进而是质的飞跃。每降低一次多项式次数就意味着减少一层乘法深度、减少一次Bootstrapping需求。第二异构输入设计精准匹配了实际需求。在真实场景中用户的查询往往由“公开上下文私有问题”构成。Sylph敏锐地捕捉到这一特点没有盲目追求“全加密”而是允许明文与密文混合处理。这使得长上下文场景变得可行——如果4096个token全部加密Bootstrapping开销将是指数级增长的。第三硬件选择体现了务实精神。RTX PRO 6000虽然不如H100强大但成本更低、更易获取。Sylph在“平民级”硬件上超越了SOTA在“旗舰级”硬件上的表现这本身就说明了算法优化的威力。局限性与挑战生成速度仍是瓶颈。每token 18-22秒的生成速度对于实时对话场景而言仍然过慢。虽然比295秒有巨大提升但与明文推理的毫秒级响应仍有几个数量级的差距。模型规模上限未知。本文成功验证了8B参数的可行性但能否扩展到70B、甚至数百B的模型仍是未知数。Bootstrapping仍是天花板。尽管Sylph通过浅层电路设计减少了Bootstrapping次数但Bootstrapping本身的高成本并未根本解决。实践应用谁应该关注这项研究隐私计算工程师Sylph展示了FHE从实验室走向工程落地的一条可行路径云服务提供商可探索“隐私保护AI推理”作为增值服务医疗、金融等强监管行业的技术决策者该技术为合规使用云端LLM提供了新可能落地建议从异构模式切入全加密128 token虽快但实际场景中“长明文上下文短加密查询”的异构模式更具实用性关注硬件选型Sylph在RTX PRO 6000上表现出色无需盲目追求H100级别硬件评估精度-性能权衡13-bit有效精度对大多数任务足够但特定高精度需求场景需额外验证预留优化空间当前性能仍有提升空间可关注后续Bootstrapping加速和多项式近似方法的进展参考资料原始论文: Scaling up FHE-based Privacy-Preserving ML: Higher Throughput, Longer Inputs for LLama-3-8BPDF全文: https://arxiv.org/pdf/2601.18511HTML版: https://arxiv.org/html/2601.18511v2