【環球網科技綜合報道】6月28日消息,北京大學與深度求索(DeepSeek)聯合推出大模型推理加速框架 DSpark 并完成開源,該技術有效破解大語言模型高并發場景推理效率難題,同等吞吐量條件下可將單用戶文本生成速度提升 60% 至 85%,相關論文、訓練代碼已上線 GitHub 開放共享。當前大語言模型***用自回歸生成邏輯,每生成一個文字單元都需完整前向運算,對話響應延遲居高不下。推測解碼是主流提速路線,但現有方案存在明顯短板:串行草稿模型候選生成耗時隨長度遞增,并行草稿模型長序列候選接受率快速下滑,高并發場景下算力浪費嚴重、系統吞吐量受限。 針對兩大核心痛點,DSpark 創新打造雙重優化機制。候選生成層面***用半自回歸架構,依托改良并行主干網絡一次性輸出候選基礎特征,搭配輕量化順序模塊補充文本前后依賴關系,僅兩層 Transformer 結構性能便超越五層傳統并行模型,兼顧生成速度與候選質量。驗證調度層面創新置信度調度驗證機制,通過硬件感知前綴調度器,結合實時算力負載、候選存活概率動態分配算力***,優先驗證高可靠文本片段,減少無效計算損耗。研究團隊選取通義千問 3、Gemma4 等主流大模型開展多場景測試,覆蓋數學推理、代碼編寫、日常對話三大任務。數據顯示,DSpark 單輪有效生成長度全面優于 Eagle3、DFlash 兩類主流基線模型,以 Qwen3-4B 為例,相比 Eagle3 提升 30.9%、相比 DFlash 提升 16.3%,既保留并行架構首位生成優勢,又解決長序列候選有效率衰減問題。工程落地環節,研發團隊完成多項底層系統優化。訓練階段優化數據傳輸邏輯、***用序列打包策略降低算力與內存消耗;部署端設計異步調度模式,規避 GPU 流水線卡頓,通過邏輯與物理計算解耦適配動態變長驗證需求,兼容主流 CUDA 硬件生態。該框架已落地 DeepSeek-V4-Flash、DeepSeek-V4-Pro 預覽版服務引擎。線上真實流量實測結果顯示,在不同用戶響應速度標準(SLA)下,系統整體吞吐量實現跨越式增長:V4-Flash 引擎保障單用戶 80token/s 生成速度時,吞吐量較原有基線提升 51%;要求 120token/s 高速輸出時,吞吐量優勢達 661%;V4-Pro 引擎 35token/s、50token/s 標準下吞吐量分別提升 52%、406%。系統可根據在線并發量自動調整驗證文本長度,低負載充分釋放算力,高負載平滑控制***競爭,自適應適配多變業務流量。據介紹,DSpark 仍存在一定優化空間,復雜低適配查詢場景下完整候選塊生成會產生固定算力開銷。現階段,深度求索已在 GitHub DeepSpec 項目開源 DSpark、DFlash、Eagle3 全套訓練代碼、評估工具與模型權重,為行業低成本落地高性能大模型推理服務提供完整技術方案,助力人工智能產業降低線上部署成本、提升用戶交互體驗。(純鈞)