跳到主要內容

通義千問發布原生世界模型 Qwen-AgentWorld


Qwen-AgentWorld 是一個原生語言世界模型,它透過跨越七個統一領域的長鏈推理來模擬智能體環境:MCP、搜尋、終端、軟體工程、安卓、Web 和作業系統。它透過一個三階段流程進行訓練:CPT 注入環境知識,SFT 啟動下一狀態預測推理,RL 提升模擬精度,訓練資料來自超過 1000 萬條真實世界的互動軌跡。與以往將世界建模視為事後附加功能的方法不同,Qwen-AgentWorld 是原生世界模型:從 CPT 階段開始,環境建模就是訓練目標。

主要特點:

  • 七大統一領域。首個在單一模型中涵蓋七個智能體互動領域的語言世界模型。
  • 原生世界模型。從CPT開始進行環境建模,而非事後適應。
  • 通用性強、可擴展且可控制的模擬器。可零樣本泛化到物件導向設計(OOD)環境(例如,爪形智能體);可控擾動和虛擬世界建構超越了真實環境訓練。
  • 智能體基礎模型。 LWM RL 在單輪非智能體軌跡上的預熱可以遷移到多輪、工具調用智能體任務,涵蓋七個基準測試,其中包括三個完全超出領域範圍的測試。

Qwen-AgentWorld 自繼續預訓練階段起,便將環境建模作為明確目標進行端到端訓練。三階段管線遵循一個核心原則:CPT 注入,SFT 激活,RL 精煉。

階段一:繼續預先訓練(CPT) 透過學習不含思維鏈的交互軌跡,將環境知識注入模型。資料來源涵蓋專用智慧體基礎架構(容器化執行沙箱、MCP 伺服器、Android/Web/OS 模擬器)、開源環境互動軌跡以及內部智慧體軌跡。除環境數據外,我們還引入了涵蓋工業控制、網路安全、法律、醫學、金融和時事等領域的專業知識語料。本階段的一項關鍵貢獻是 輪次層級的資訊理論損失掩碼:透過 4 個表層統計量識別每個(動作, 觀測)對中真正承載環境資訊的對話輪,對其餘輪施加掩碼,使其不參與 loss 計算,但仍保留為上下文輸入。

階段二:監督微調(SFT) 透過 <think>...</think> 包裹的思考過程,為下一狀態預測啟動出顯式的思維鏈推理模式。我們採用拒絕採樣(rejection sampling)篩選高品質思維鏈軌跡,最終獲得 7,094 個訓練樣本。

階段三:強化學習(RL) 以混合獎勵訊號精煉輸出品質。我們基於 GSPO 演算法進行 RL 訓練,獎勵訊號由兩部分組成:基於評分準則的 LLM 評判器(從多個維度評估產生品質),以及基於規則的驗證器(用於客觀可驗證的正確性檢查)。

為系統評估語言世界模型,通義千問推出 AgentWorldBench 一個綜合性評測基準。此基準是基於 5 個前緣模型在 9 個成熟評測集(如 Tool Decathlon、Terminal-Bench 1.0 & 2.0、OSWorld-Verified 等)上的真實環境交互觀測建構而成。每個評測樣本均配備真實環境執行所得的 ground-truth 觀測,支持基於參考的精確評分。 AgentWorldBench 採用開放式評分準則(rubric),從格式、事實性、一致性、真實性和品質五個維度全面評估世界建模能力,深入考察模型的推理能力、領域知識以及長上下文處理水平。

AgentWorldBench 評測結果:各領域五維評分準則平均數。 Qwen-AgentWorld-397B-A17B 取得最高整體得分(58.71),超越 GPT-5.4(58.25)及其他前沿模型。

Qwen-AgentWorld-35B-A3B(Hugging Face, ModelScope)語言世界模型,採用 MoE 架構,總參數 35B / 激活參數 3B,支援 256K 上下文。

https://kopyai.com/zh-tw/latest/view/type.news/0/74

Picture Source
Qwen

留言

這個網誌中的熱門文章

標普 500 指數和那斯達克指數結束兩週連漲勢頭,人工智慧引發的動盪令科技股承壓

週五美國股市波動劇烈,半導體股在有關 OpenAI ( OPAI.PVT ) IPO 可能推遲的報道出現後回落,這加劇了本週令市場劇烈震蕩的不利因素。 科技股為主的那斯達克指數(^IXIC)下跌 0.2%,而標準普爾 500 指數(^GSPC)小幅下跌,這兩個指數本週分別下跌 超過 4% 和近 2%。 道瓊工業指數(^DJI)科技股佔比較低,跌破橫盤整理線,但周漲幅不到 1%。 蘋果公司( AAPL)上調 MacBook 和 iPad 價格後,人們越來越擔心記憶體和儲存組件成本飆升可能會衝擊設備製造商。內存晶片製造商美光科技( MU)亮眼的財報表明,這種成本壓力還將繼續。 同時,《紐約時報》報道稱,OpenAI 正在考慮將其巨額 IPO 推遲到 2027 年,這也抑制了人們對科技股的興趣。 由於市場預期聯準會今年將升息,人工智慧交易已承壓。聯準會首選的通膨指標—個人消費支出指數— —5月份的強勁表現,進一步鞏固了這一預期。 https://kopyai.com/zh-tw/markets/view/type.stock.us/0/165 Picture Source unsplash

西班牙監管機構表示,歐盟數位貨幣監管截止日期不會延長,幣安仍未獲得許可

西班牙最高證券監管機構週五表示,該國不會延長數位貨幣公司根據新規註冊的最後期限——儘管幣安公司正努力完成註冊。 根據歐盟新實施的 MiCA 數位貨幣框架,企業必須在 7 月 1 日前在成員國註冊並繼續營運。如果未能在下週前完成註冊,則將強制停止營業。下週後,歐洲消費者將無法與未經授權的數位貨幣服務提供者進行交易。 全球最大的數位貨幣交易所幣安曾申請在希臘根據《貨幣與公司法》(MiCA)註冊。但先前有報告指出希臘不太可能批准註冊申請,幣安本周宣布撤回在希臘的申請。目前,幣安正尋求在另一個歐盟成員國註冊,但由於下週三截止日期臨近,幣安很可能被迫至少暫時停止在歐洲的業務運作。 根據路透社報道,西班牙國家證券市場委員會主席卡洛斯·聖巴西利奧週五表示,7 月 1 日的最後期限“不會有任何例外或延期”。 聖巴西利奧對幣安等大型數位貨幣平台表示擔憂,這些平台由於缺乏 MiCA 合規性,可能在幾天內關閉。 他說:“我們擔心的是……過渡期的結束將如何展開,以及人們將如何適應新的環境。” 該監管機構補充說,他和一些人正在與尚未獲得牌照的主要數位貨幣公司聯繫,以確保他們制定計劃將客戶資產轉移到其他提供者,並確保投資者的權利。 一旦數位貨幣公司在歐盟國家註冊,其牌照即可「通行」至其他司法管轄區。歐盟成員國在金融監管方面採取了多種不同的方法,從塞浦路斯和馬耳他等較為寬鬆的監管體系,到法國和德國等以監管嚴格著稱的體系,不一而足。 雖然每個歐盟國家處理申請的方式可能各不相同,但所有國家都將執行同一套更廣泛的數位貨幣相關規則。 https://kopyai.com/zh-tw/markets/view/type.stock.us/0/166 Picture Source unsplash

DeepSeek-V3.1 發布,邁向 AI Agent

DeepSeek-V3.1 在 DeepSeek-V3.1-Base 的基礎上進行後訓練,後者基於原始 V3 基礎檢查點,通過兩階段長上下文擴展方法構建,遵循原始 DeepSeek-V3 報告中概述的方法。 DeepSeek 透過收集更多長文件並大幅擴展兩個訓練階段來擴展資料集。32K 擴展階段的標記數量增加了 10 倍,達到 6,300 億個標記,而 128K 擴展階段的標記數量增加了 3.3 倍,達到 2,090 億個標記。此外,DeepSeek-V3.1 使用 UE8M0 FP8 規模資料格式進行訓練,以確保與微尺度資料格式相容。 DeepSeek-V3.1 是一個同時支持思考模式和非思考模式的混合模型。相較於上一版本,本次升級帶來了多個方面的改進: 混合推理:思考與非思考-一個模型,兩種模式 更快的思考:DeepSeek-V3.1-Think 與 DeepSeek-R1-0528 相比,可以在更短的時間內找到答案 更強大的代理商技能:後製訓練可提高工具使用率和多步驟代理任務 DeepSeek-V3.1 模型提升了工具使用、程式碼生成和推理效率,在高難度基準測試中實現了與 DeepSeek-R1 相當的效能,同時響應速度更快。它支援結構化工具呼叫、代碼代理和搜尋代理,適用於研究、編碼和代理工作流程。 工具和代理程式升級 在 SWE / Terminal-Bench 上獲得更好的結果 針對複雜搜尋任務的更強大的多步驟推理 思考效率大幅提升 模型更新 V3.1 基礎:在 V3 基礎上繼續對 840B 個 token 進行預訓練,以進行長上下文擴展 Tokenizer 和聊天範本已更新 - 新的 tokenizer 設定: https://huggingface.co/deepseek-ai/DeepSeek- V3.1/blob/main/tokenizer_config.json V3.1 基礎開源權重: https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Base V3.1 開源權重: https://huggingface.co/deepseek-ai/DeepSeek-V3.1 價格變動 新定價開始及非高峰折扣結束時間為 2025 年 9 月 5 日 16:00(UTC 時間) 在此之前,API 遵循當前定價 ...