北京时间9月13日凌晨,美国OpenAI公司发布全新模型技术产品o1,包括两种版本o1-preview和o1-mini,前者具有高级推理功能,在推理数学、编程、科学等问题的能力上有显著提高,性能接近理化生博士水平;后者则是一款更小巧、专为代码生成优化的模型。
这就是此前传言中高级推理能力强大模型的“Strawberry”项目。也有人分析称,o1是Orion大模型简称。
OpenAI表示,对于复杂推理任务而言,新模型代表着AI能力的崭新水平,因此值得将计数重置为1,给它一个有别于“GPT-4”系列的全新名号。同时,这也预示着,AI时代迎来崭新的起点——能够进行通用复杂推理的大模型重要到来。
需要注意的是,o1目前的聊天体验还比较基础。不同于其前身GPT-4o,o1目前无法浏览网页或处理文件分析功能。尽管它具备图像分析功能,但该功能暂时关闭,等待进一步测试。此外,o1还有消息量限制——目前o1-preview每周限额30条、o1-mini每周50条。
即日起,o1-preview 和 o1-mini两个版本已经在ChatGPT Plus/Team和API接口渠道上线,企业和教育用户将于下周初获得优先访问权限。
OpenAI CEO奥尔特曼(Sam Altman)表示,“这是我们迄今为止功能最强大、最一致的模型系列 o1,也是迄今为止我们最好的推理模型。虽然o1仍然存在缺陷并有限,但使用时的感觉依然更加令人印象深刻。”
具体来看,OpenAIo1可以解决比以前GPT时期的科学、编码和数学模型更难的问题。
OpenAI的研究负责人Jerry Tworek透露,o1模型背后的训练与之前的产品有着根本性的区别。之前的GPT模型旨在模仿其训练数据中的模式,而o1的训练旨在让其独立解决问题。在强化学习的过程中,使用奖励和惩罚机制来“教育”AI使用“思维链”来处理问题,就像人类习得拆解、分析问题的方式一样。
o1上线之后,现在ChatGPT可以在回答问题前先仔细思考,而不是立即脱口而出答案。就像人类大脑的系统1和系统2,ChatGPT已经从仅使用系统1(快速、自动、直观、易出错)进化到了可使用系统2思维(缓慢、深思熟虑、有意识、可靠)。这让它能够解决以前无法解决的问题。
所谓推理大模型,就是AI会在回答之前花更多时间进行思考,就像人类思考解决问题的过程一样,而非预测单词生成的序列。比如通过文字点开AI思考的过程,还会出现AI表示“我在思考这个事情这么做行不行”、“啊时间不够了得尽快给出答案”等。OpenAI确认,这里展示的并不是原始的思维链,而是“模型生成的摘要”,公司也坦率承认这里有保持“竞争优势”的因素。
根据测试,在国际数学奥林匹克(IMO)资格考试中,GPT-4o仅正确解答了13%的问题,而o1模型正确解答了83%的问题。而在编程能力比赛Codeforces中,o1模型拿到89%百分位的成绩,而GPT-4o只有11%。
OpenAI发现,随着更多的强化学习(训练时计算)和更多的思考时间(测试时计算),o1的性能持续提高。而且扩展这种方法的限制与大模型预训练的限制有很大不同,OpenAI也还在继续研究。
OpenAI技术文件称,实验结果表明:o1超越了人类专家的表现,性能接近理科博士水平,成为第一个在该基准测试中做到这一点的模型。而在下一个更新的版本中,AI在物理、化学和生物学的挑战性基准测试中,表现能够与博士生水平类似。
除了OpenAI o1-preview外,OpenAI今晨也同步推出了o1-mini模型,更快、更便宜,定价也比preview版本降低了80%,适用于需要推理但不需要广泛世界知识的场景。
很显然,尽管新的OpenAI o1还不具备更全面问题解决能力,但显著提升的推理能力使其在科学、编程、数学等专业领域具备了更大的用途,以及 AI Agent 相关技术的下限和上限被整体拉高,大幅提升科学研究和生产端的能力,对于消费端来说意义不算太大。
英伟达首席科学家Jim Fan表示,新的o1需要消耗更大的算力和数据,并且能够形成数据飞轮效应,正确的答案及其思考过程可以成为很好的训练数据。从而不断改进推理核心,类似AlphaGo的价值网络随着MCTS生成更多精炼数据而改进。
天风国际称,OpenAI o1系列模型大幅增强推理能力,并宣布新的Scaling范式:通过RL解锁Test time compute(推理时间)。
此外,9月11日彭博社报道称,OpenAI正在商谈以1500亿美元(约合10675.35亿元,1.07万亿元)的估值进行新一轮融资,有望从投资者那里筹集65亿美元,投资方包括苹果、英伟达、微软等。同时,OpenAI还在谈判以循环信贷安排的形式从银行借款50亿美元。
成立于2015年的OpenAI,一直处于科技行业向 AI 快速转变的中心,其发布的聊天机器人产品ChatGPT于2022年首次亮相,引发全球 AI 投资热潮。OpenAI首席财务官Sarah Friar近日在内部备忘录中表示,新一轮融资将支持公司对计算能力和其他运营费用的需求。她强调,该公司的目标是允许员工在今年晚些时候的收购要约中出售部分股份。
OpenAI API突然对中国“断供”,国内套壳公司将受到重大影响?事实并非如此。
但实际上,OpenAI API停服这件事对于国内影响有限,主要原因在于国内大模型网站都需经过备案和审批。
杨元庆称AI是联想史诗级机遇;OpenAI将允许用户直接使用ChatGPT;郑爽无财产可供执行;门店回应买保时捷送小米SU7。
AI大爆发之时,曾有人调侃称“我们希望机器人帮人类扫地、洗碗,是因为人类要去写诗、画画。