跳到主要內容

OpenAI 發布推理模型最佳實踐!


OpenAI 提供兩種類型的模型:推理模型(例如 o1 和 o3-mini)和GPT 模型(如 GPT-4o)。這些模範家庭的行為各有不同。

推理模型與 GPT 模型

與 GPT 模型相比,我們的 o 系列模型擅長不同的任務並且需要不同的提示。一個模範家庭並不比另一個更好——他們只是不同而已。

我們訓練我們的 o 系列模型(「規劃者」)對複雜任務進行更長時間、更深入的思考,使其能夠有效地制定策略、規劃複雜問題的解決方案,並根據大量模糊資訊做出決策。這些模型還可以高精度地執行任務,使其成為數學、科學、工程、金融服務和法律服務等原本需要人類專家的領域的理想選擇。

另一方面,我們的低延遲、更具成本效益的 GPT 模型(「主力」)旨在實現直接執行。應用程式可能會使用 o 系列模型來規劃解決問題的策略,並使用 GPT 模型來執行特定任務,尤其是在速度和成本比完美的準確性更重要時。

如何選擇

對於您的用例來說什麼是最重要的?

  • 速度和成本→GPT 模型速度更快,而且成本更低
  • 執行明確定義的任務→GPT 模型可以很好地處理明確定義的任務
  • 準確性與可靠性→ o 系列模型是可靠的決策者
  • 解決複雜問題→ o 系列模型解決模糊性和複雜性

如果速度和成本是完成任務時最重要的因素,而您的用例由簡單、定義明確的任務組成,那麼我們的 GPT 模型最適合您。但是,如果準確性和可靠性是最重要的因素,並且您需要解決非常複雜、多步驟的問題,那麼我們的 o 系列模型可能適合您。

大多數 AI 工作流程都會結合使用這兩種模型——o 系列用於代理規劃和決策,GPT 系列用於任務執行。

何時使用我們的推理模型

以下是我們從客戶和 OpenAI 內部觀察到的一些成功使用模式。這並不是對所有可能用例的全面回顧,而是對測試我們的 o 系列模型的一些實用指導。

1. 處理模糊任務

推理模型特別擅長利用有限的資訊或不同的訊息,並透過簡單的提示,理解使用者的意圖並處理指令中的任何差距。事實上,推理模型在做出無根據的猜測或試圖填補資訊空白之前,通常會提出澄清問題。

2. 大海撈針

當你傳遞大量非結構化資訊時,推理模型擅長理解並提取最相關的資訊來回答問題。

3. 在大型資料集中尋找關係和細微差別

我們發現推理模型特別擅長推理包含數百頁密集、非結構化資訊的複雜文檔,例如法律合約、財務報表和保險索賠。這些模型特別擅長在文件之間進行類比,並根據數據中所代表的不言而喻的事實做出決策。

4. 多步驟代理規劃

推理模型對於代理規劃和策略發展至關重要。我們已經看到了成功,當推理模型被用作「規劃者」時,它會為問題提供詳細的多步驟解決方案,然後根據高智慧或低延遲是否最重要,為每個步驟選擇和分配正確的 GPT 模型(「執行者」)。

5.視覺推理

截至目前,o1 是唯一支援視覺功能的推理模型。它與 GPT-4o 的不同之處在於,o1 甚至可以掌握最具挑戰性的視覺效果,例如結構模糊的圖表和表格或影像品質不佳的照片。

6. 審查、調試和改進程式碼品質

推理模型在審查和改進大量程式碼方面特別有效,由於模型的延遲較高,因此通常在後台運行程式碼審查。

7. 其他模型響應的評估和基準測試

我們還發現推理模型在基準測試和評估其他模型響應方面表現良好。資料驗證對於確保資料集的品質和可靠性非常重要,尤其是在醫療保健等敏感領域。傳統的驗證方法使用預先定義的規則和模式,但像 o1 和 o3-mini 這樣的高階模型可以理解資料的上下文和推理,從而實現更靈活、更聰明的驗證方法。

https://kopyai.com/zh-tw/latest/view/type.news/0/14

Picture Source:

openai.com

留言

這個網誌中的熱門文章

標普 500 指數和那斯達克指數結束兩週連漲勢頭,人工智慧引發的動盪令科技股承壓

週五美國股市波動劇烈,半導體股在有關 OpenAI ( OPAI.PVT ) IPO 可能推遲的報道出現後回落,這加劇了本週令市場劇烈震蕩的不利因素。 科技股為主的那斯達克指數(^IXIC)下跌 0.2%,而標準普爾 500 指數(^GSPC)小幅下跌,這兩個指數本週分別下跌 超過 4% 和近 2%。 道瓊工業指數(^DJI)科技股佔比較低,跌破橫盤整理線,但周漲幅不到 1%。 蘋果公司( AAPL)上調 MacBook 和 iPad 價格後,人們越來越擔心記憶體和儲存組件成本飆升可能會衝擊設備製造商。內存晶片製造商美光科技( MU)亮眼的財報表明,這種成本壓力還將繼續。 同時,《紐約時報》報道稱,OpenAI 正在考慮將其巨額 IPO 推遲到 2027 年,這也抑制了人們對科技股的興趣。 由於市場預期聯準會今年將升息,人工智慧交易已承壓。聯準會首選的通膨指標—個人消費支出指數— —5月份的強勁表現,進一步鞏固了這一預期。 https://kopyai.com/zh-tw/markets/view/type.stock.us/0/165 Picture Source unsplash

Figure AI 發布新一代的神經系統 Helix 02

Figure AI 推出新一代的單一神經系統 Helix 02,可直接從像素控制全身,從而在整個房間內實現靈巧、遠距離的自主移動。 新特色 自主長距離移動操作: Helix 02 能夠在一個完整的廚房內完成洗碗機的裝卸工作——這項全程自主任務耗時四分鐘,整合了行走、操作和平衡能力,無需任何重置或人工幹預。我們相信這是迄今為止人形機器人自主完成的最長距離、最複雜的任務。 所有感測器輸入,所有執行器輸出: Helix 02 透過一個統一的視覺運動神經網絡,將每個板載感測器(視覺、觸覺和本體感覺)直接連接到每個執行器。 基於人體資料的類人全身控制:所有結果均由系統 0實現,該系統是一個經過訓練的全身控制器,基於超過 1000 小時的人體運動資料和模擬到實際的強化學習進行訓練。系統 0 用一個神經網路先驗取代了 109,504 行手工編寫的 C++ 程式碼,從而實現了穩定、自然的運動。 新的靈巧度類別:借助 Figure 03 的嵌入式觸覺感測和掌心攝像頭,Helix 02 可以執行以前無法完成的操作:取出單個藥丸、分配精確的注射器容量,以及在自身遮擋的情況下從雜亂中取出細小的、不規則的物體。 根據最新的影片結果說明: 在操作約束下的運動。機器人能夠一邊行走一邊抓取易碎物品,並在每一步都保持穩定的抓握。 充分利用全身:當雙手被佔用時,機器人會用臀部關上抽屜,用腳抬起洗碗機門——將整個身體當作工具,而不是只依靠雙手。 雙手協調配合貫穿始終:物體被拿起、在雙手之間轉移、堆疊和放置,而雙臂則作為一個協調的系統進行操作。 跨尺度的運動範圍。同一個神經網路既能產生毫米級的指尖運動,也能產生房間尺度的移動-動態範圍跨越四個數量級。 長時域序列執行:61 個運動操作動作,順序正確,並具有隱式錯誤恢復能力。機器人可在數分鐘的執行時間內保持任務狀態。 Helix 02 的觸覺感測和掌部攝影機突破了純視覺策略的限制,實現了更多操作任務。 Helix 02 的 S0 提供學習到的全身控制,S1 將所有感測器連接到所有執行器,S2 實現對擴展任務的語義推理,從而實現了新的目標:連續的、房間規模的自主性,無縫地融合了行走和操作,目前研究結果尚處於初步階段,但已展現出持續性全身自主控制所能達到的成就 https://kopyai.com/zh-tw/latest/view/type.news/0/60...

西班牙監管機構表示,歐盟數位貨幣監管截止日期不會延長,幣安仍未獲得許可

西班牙最高證券監管機構週五表示,該國不會延長數位貨幣公司根據新規註冊的最後期限——儘管幣安公司正努力完成註冊。 根據歐盟新實施的 MiCA 數位貨幣框架,企業必須在 7 月 1 日前在成員國註冊並繼續營運。如果未能在下週前完成註冊,則將強制停止營業。下週後,歐洲消費者將無法與未經授權的數位貨幣服務提供者進行交易。 全球最大的數位貨幣交易所幣安曾申請在希臘根據《貨幣與公司法》(MiCA)註冊。但先前有報告指出希臘不太可能批准註冊申請,幣安本周宣布撤回在希臘的申請。目前,幣安正尋求在另一個歐盟成員國註冊,但由於下週三截止日期臨近,幣安很可能被迫至少暫時停止在歐洲的業務運作。 根據路透社報道,西班牙國家證券市場委員會主席卡洛斯·聖巴西利奧週五表示,7 月 1 日的最後期限“不會有任何例外或延期”。 聖巴西利奧對幣安等大型數位貨幣平台表示擔憂,這些平台由於缺乏 MiCA 合規性,可能在幾天內關閉。 他說:“我們擔心的是……過渡期的結束將如何展開,以及人們將如何適應新的環境。” 該監管機構補充說,他和一些人正在與尚未獲得牌照的主要數位貨幣公司聯繫,以確保他們制定計劃將客戶資產轉移到其他提供者,並確保投資者的權利。 一旦數位貨幣公司在歐盟國家註冊,其牌照即可「通行」至其他司法管轄區。歐盟成員國在金融監管方面採取了多種不同的方法,從塞浦路斯和馬耳他等較為寬鬆的監管體系,到法國和德國等以監管嚴格著稱的體系,不一而足。 雖然每個歐盟國家處理申請的方式可能各不相同,但所有國家都將執行同一套更廣泛的數位貨幣相關規則。 https://kopyai.com/zh-tw/markets/view/type.stock.us/0/166 Picture Source unsplash