Google 發表 TurboQuant:把 KV cache 壓縮到 3-bit,緩解長上下文推論成本
TurboQuant 透過新型量化與誤差修正方法,大幅降低模型推論時 KV cache 的記憶體負擔,目標是在不犧牲準確度下提升長上下文運算效率。
第 12 頁,共 36 頁 · 共 353 篇文章
TurboQuant 透過新型量化與誤差修正方法,大幅降低模型推論時 KV cache 的記憶體負擔,目標是在不犧牲準確度下提升長上下文運算效率。
Microsoft 公布 Copilot 角色型方案 2026 wave 1 規劃,聚焦 Copilot for Sales 與 Copilot for Finance 的工作流程整合、洞察摘要與治理擴充,協助企業以可控方式擴大部署。
新一代 Workspace Agents 讓團隊可在 ChatGPT 內建立共享代理人,並連接 Slack、雲端硬碟與 CRM 等系統,把跨工具的例行工作自動化。
美國公布 National AI Policy Framework 的立法建議,主張以聯邦框架統一 AI 規範,並在部分範疇預先排除州級差異化規定,同時保留兒童保護與反詐騙等傳統州權。
中國第十五個五年規劃全文逾50次提及人工智能,確立「AI+行動計劃」為核心政策主軸,計劃建設超大規模智能算力集群、推動開源AI生態,並將AI深度整合至製造、金融、物流、農業等各主要產業。
Google 在 Cloud Next 2026 上發布第八代 TPU,首次推出訓練專用 TPU 8t 與推論專用 TPU 8i 兩款獨立架構晶片,8t 較上代提升 2.8 倍訓練性能,8i 推論每美元性能提升 80%,預計今年底正式供應。
香港人工智能研發院有限公司正式進入籌備階段,獲 10 億港元政府撥款,首要任務包括整合本地研發的大型語言模型、打通學術研究至產業應用的轉化鏈,並協助制定 AI 治理框架,計劃於 2026 年下半年正式運作。
NVIDIA 推出開源企業 AI 代理工具包(Agent Toolkit),內含 OpenShell 自主執行環境、Nemotron 模型及 AI-Q 藍圖,支援在企業現有安全與政策框架下建構長時間運行的自主代理,首批 17 家平台合作夥伴已同步採用。
NVIDIA 在 GTC 2026 發布 Groq 3 語言處理單元(LPU),這是其以 200 億美元授權協議獲得 Groq 技術後的首款晶片,與 Vera Rubin GPU 協同運作,推論每兆瓦吞吐量較 Blackwell NVL72 提升 35 倍,預計 2026 年下半年供貨。
OpenAI 與微軟宣布修訂合作協議,微軟持有的 OpenAI 技術授權延續至 2032 年,但性質由獨家改為非獨家,OpenAI 產品可跨雲部署;同時微軟停止向 OpenAI 支付收益分成,OpenAI 則繼續向微軟付款至 2030 年並設總額上限。