久久国产亚洲观看-久久国产亚洲欧美日韩精品-久久国产亚洲精品麻豆-久久国产成人-999成人精品视频在线-999国产高清在线精品

首頁 > 汽車生活 > 汽車生活 > 復雜推理大模型OpenAI o1亮相,數(shù)學與代碼能力飛躍

復雜推理大模型OpenAI o1亮相,數(shù)學與代碼能力飛躍

發(fā)布時間:2024-09-16 16:25:38來源: 13041198719

平安證券近日發(fā)布AI動態(tài)跟蹤系列(三):復雜推理大模型OpenAI o1亮相,數(shù)學與代碼能力飛躍。

以下為研究報告摘要:

9月13日,OpenAI正式發(fā)布并上線o1系列模型o1-preview和o1-mini。

平安觀點:

OpenAI計數(shù)器重置回1,o1系列開啟復雜推理序幕。本次OpenAI發(fā)布的是o1-preview(預覽版)和o1-mini(擅長STEM、更快、更便宜)兩個版本,ChatGPT付費用戶和API用戶可以使用。根據(jù)OpenAI官網(wǎng)介紹,o1系列被定位為用于解決難題的推理模型。對于復雜的推理任務來說,OpenAI認為o1是一個重大進步,代表了AI能力的新水平,鑒于此,OpenAI將計數(shù)器重置回1并將此系列模型命名為OpenAI o1。OpenAI研究發(fā)現(xiàn),隨著強化學習(訓練時計算)和思考時間(測試時計算)的增加,o1的性能會不斷提高。因此在體驗上,與此前模型不同點在于,OpenAIo1在作出反應之前,需要像人類一樣,花更多時間思考問題。

o1基準表現(xiàn)明顯優(yōu)于GPT-4o,數(shù)學與編碼能力實現(xiàn)飛躍。OpenAI實驗結果表明,在絕大多數(shù)推理任務中,o1的表現(xiàn)明顯優(yōu)于GPT-4o。尤其是在具有挑戰(zhàn)性的推理基準上,o1實現(xiàn)了能力飛躍,1)數(shù)學能力:在美國數(shù)學奧林匹克(AIME2024)預選賽題目中,GPT-4o平均只能解決12%的問題,o1正式版達到平均74%的準確率,在使用學習評分函數(shù)重新排名1000個樣本后準確率達到93%,相當于美國排名前500的學生水平。2)編碼能力:在競爭性編程問題(Codeforces)比賽中,o1-preview、o1分別超越了62%、89%的人類競爭者,而對比GPT-4o僅超過11%。3)特定專業(yè)領域能力:GPQA diamond測試(專門用于評估模型在化學、物理和生物學等領域的專業(yè)知識水平)中,o1不僅成功完成了測試,更是超越了人類專家的表現(xiàn),成為首個在GPQA diamond基準上擊敗人類專家的AI模型。

o1引入思維鏈優(yōu)化邏輯推理,助力模型性能與安全提升。o1優(yōu)越能力的背后,核心突破在于運用思維鏈(chain of thought)方法來處理復雜任務,OpenAI介紹到,類似于人類在回答困難問題之前可能會思考很長時間,o1在嘗試解決問題時會使用思維鏈。通過強化學習,o1學會打磨其思維鏈并改進它所使用的策略。o1學會了識別和糾正錯誤,學會了將棘手的步驟分解為更簡單的步驟,學會了在當前方法不起作用時嘗試不同的方法,此過程顯著提高了模型的推理能力。在OpenAI的一個官方演示中展示了o1-preview解答復雜問題的邏輯推理過程,o1-preview在過程中逐步顯示思考、翻譯問題、定義變量、理解問題、構建方程、解方程等與人類推理相似的步驟,最終輸出結論。同時,OpenAI認為思維鏈推理也為大模型安全性的提升提供了新思路,o1-preview在關鍵越獄評估和用于評估模型安全拒絕邊界的最嚴格內部基準上取得了顯著的改進。

投資建議:OpenAI推出專攻難題的o1系列大模型,應對復雜推理任務,o1引入思維鏈(Chain of Thought)提升邏輯推理能力,絕大多數(shù)基準表現(xiàn)不僅明顯超越GPT-4o,而且在數(shù)學與編碼能力上實現(xiàn)了重要飛躍,在理化生等專業(yè)領域的知識水平也達到新高度。OpenAI的動向始終引領全球大模型的發(fā)展,我們認為o1的正式亮相有望開啟復雜推理大模型的序幕,一方面對算力提出了更大需求,同時也將賦能下游AI應用(如編程、教育)的快速迭代。我們堅定看好AI主題的投資機會:1)算力方面,推薦工業(yè)富聯(lián)、浪潮信息、中科曙光、紫光股份、神州數(shù)碼、海光信息、龍芯中科,建議關注寒武紀、景嘉微、軟通動力;2)算法方面,推薦科大訊飛;3)應用場景方面,強烈推薦中科創(chuàng)達、恒生電子、盛視科技,推薦金山辦公,建議關注萬興科技、福昕軟件、同花順、彩訊股份;4)網(wǎng)絡安全方面,強烈推薦啟明星辰。

汽車生活更多>>

2025年山東大學齊魯醫(yī)院事業(yè)編招聘啟事 2024年遵義醫(yī)科大學第二附屬醫(yī)院招聘(非編制)工作人員方案 2024年海口市美蘭區(qū)和平南街道辦事處關于擬招聘公益性崗位工作人員的公告(2人) 2024年湖北鐵道運輸職業(yè)學院(武漢鐵路技師學院)專項招聘工作人員公告(4人) 2024年中國中醫(yī)科學院廣安門醫(yī)院招聘公告 價格下探至25萬元以內?比亞迪夏前景展望 7月豪華中級車終端銷量:奔馳C級月銷13838輛領跑 官方一口價低至7.99萬元起 途岳新銳要和新能源搶市場 并入上汽大眾銷售網(wǎng)絡 斯柯達在中國還有希望嗎 10.99萬元起,全系518km續(xù)航,東風風神L7 EV有點給力! 預售11.98萬元起,最高650km續(xù)航+激光雷達,AION RT來了 評凱迪拉克全新XT5:價格殺紅眼的同時,還不忘“玩豪華”? 主打就是聽勸!2025款比亞迪漢全面升級,僅售16.58萬元起 2024年鷹潭市月湖區(qū)部分區(qū)直事業(yè)單位選調工作人員公告 2024年撫州市資溪縣事業(yè)單位引進高素質人才公告 2024年南昌市第一醫(yī)院臨床護士及部分技師崗位招聘公告 2024年南昌市勞動保障事務代理中心招聘工作人員公告 2024年吉安市青原區(qū)人民醫(yī)院(總醫(yī)院) 招聘公告 2024年南昌經(jīng)濟技術開區(qū)人民醫(yī)院耳鼻喉科醫(yī)生招聘公告 2024年江西中醫(yī)藥大學高層次人才招聘公告 2024年吉安市永豐縣某單位招聘派遣員工公告 增程車型升級智慧新藍鯨3.0,長安啟源全新A07真心版將于18日上市 10月18日上市!增程/純電可選,配置升級,長安啟源A07真香版 車長4988毫米,配2.0T+8AT,降至14.78萬,家用可以看這款B級車 配33英寸中控屏,237馬力,降至21.97萬,家用可看這款豪華B級車 奧運選手黃雅瓊成問界新M7 Pro車主,新車究竟有何吸引力? 配置升級價格更香 2025款深藍SL03上市 售11.99-14.69萬 無懼國境線復雜路況考驗 問界新M7國慶期間持續(xù)熱銷 奇瑞艾瑞澤8高能版新車上市 12.99萬起 新增瑪瑙紅配色 雷克薩斯 RX 銷量大跌,低至 33 萬且新增 2.0T+8AT,是否值的入?
主站蜘蛛池模板: 欧美性色欧美a在线播放 | 日产一一到六区网站免费 | 国产亚洲人成在线影院 | 私人毛片免费高清影视院丶 | 欧美一区二区三区播放 | 欧美视频在线观看一区二区 | 成人午夜看片在线观看 | 免费一级a毛片在线 | 偷拍自拍日韩 | 亚洲一区二区在线免费观看 | 69交性视频 | 日本特黄特色高清免费视频 | 高清一区在线 | 欧美日韩精品一区二区三区 | 久久人人草 | 国产成人一区在线播放 | 亚洲精品久久一区二区无卡 | 亚洲 欧美 日韩在线 | 黄色成人免费网站 | 最新亚洲一区二区三区四区 | 成人爽爽大片在线观看 | 精品国产视频在线观看 | 欧美日韩精品一区二区 | 久久伊人精品热在75 | 美美女高清毛片视频免费观看 | 亚洲性在线观看 | 欧美综合一区 | 女人张开腿等男人桶免费视频 | 欧美成一级 | 99精品视频在线视频免费观看 | 欧洲一级片 | 午夜限制r级噜噜片一区二区 | 亚洲99久久久久综合 | 成人免费一区二区三区视频软件 | 欧美午夜网 | 亚洲精品综合一区二区 | 日本亚洲视频 | 亚洲网站在线播放 | 美女黄色在线网站大全 | 国产亚洲综合精品一区二区三区 | 天天插夜夜爽 |