是我创造了首个 LLM:Kaggle 前首席科学家一句话引发 AI 学术圈考古行动
来源:陌客软件园 时间:2025-04-09 16:41:39
论如何在技术圈争论中一句话噎到对方: 哥们,是我创造了第一个大语言模型。 发言者 Jeremy Howard 为澳大利亚昆士兰大学名誉教授、曾任 Kaggle 创始总裁和首席科学家,现 answer.ai 与 fast.ai 创始人。 事情的起因是有人质疑他最近的项目 llms.txt 在帮助大模型爬取互联网信息上并没太大作用,从而引发了这段争论,迅速引起众人围观。 闻讯而来的“赛博考古学家们”一番考据之后,发现第一个大语言模型这个说法还真有理有据: 2018 年初,Jeremy Howard 发表的论文 ULMFiT,使用非监督预训练-微调范式达到当时 NLP 领域的 SOTA。 甚至 GPT-1 的一作 Alec Radford,在发表 GPT-1 时也公开承认过 ULMFiT 是灵感来源之一。 有人搬出综述论文,指出从“遗传学”视角看,ULMFiT 是所有现代大模型“最后的共同祖先”。 还有好事者软件工程师 Jonathon Belotti,专门写了一篇完整考据《谁才是第一个大语言模型》 大语言模型起源考据 首先来介绍一下 ULMFiT 这篇论文,入选 ACL 2018: 提出有效迁移学习方法,可应用于 NLP 领域的任何任务,并介绍了微调语言模型的关键技术,在六个文本分类任务上的表现明显优于当时的 SOTA 方法,在大多数数据集上将错误率降低了 18-24%。此外,仅使用 100 个带标签的示例,它的性能就与在 100 倍以上数据上从头开始训练的模型性能相当。 那么 ULMFit 算不算第一个大语言模型呢?Jonathon Belotti 考据遵循这样的思路: 首先找一个大家都公认肯定算大语言模型的成果,GPT-1 肯定符合这个标准。 再从 GPT-1 和后续 GPT-2、GPT-3 中提取一个模型成为成为大语言模型的标准: 首先要是一个语言模型,根据输入预测人类书面语言的组成部分,不一定是单词,而是 token 核心方法是自监督训练,数据集是未标记的文本,与此前特定于任务的数据集有很大不同 模型的行为是预测下一个 token 能适应新的任务:不需要架构修改,就有 few-shot 甚至 one-shot 能力 通用性:可以先进的性能执行各种文本任务,包括分类、问答、解析等 接下来分析 GPT-1 引用的几个重要模型:原版 Transformer,CoVe,ELMo 和 ULMFiT。 Transformer 虽然是现代主流大模型的架构基础,但原版只用于机器翻译任务,还不够通用。同时非 Transformer 架构如 LSTM、Mamba 甚至 Diffusion 也可被视作大型语言模型。 CoVE 提出了语境化词向量,是迁移学习领域的一项重要创新,但它通过监督学习训练(英语翻译德语)创建向量,不符合自监督学习的条件。 ELMo 使用了自监督预训练和监督微调范式,但在 few-shot 能力上还差点意思。 总之在作者 Jonathon Belotti 看来,CoVE 和 ELMo 都还没达到大语言模型的门槛。 最后再来看 ULMFiT,其名字代表在文本分类任务微调的通用语言模型(Universal Language Model Fine-tuning for Text Classification)。 它是一个在 WikiText 数据上自监督训练的 LSTM 模型,能够以低成本适应新任务,无需更改架构即可执行大量文本分类任务,且达到当时的 SOTA 性能。 与 GPT-1 相比,只差在微调不够方便,以及应用任务的广度。 GPT-1 论文原文中,也指出“最接近我们工作的”就是 ULMFiT 与谷歌的半监督序列学习(Semi-supervised Sequence Learning)了。 GPT-1 论文还声称,把 LSTM 换成 Transformer 后能拓展预训练模型的预测能力,比 ULMFit 任务适应性更高。 考据者 Jonathon Belotti 最后总结到: 成为第一重要么?我认为有一点重要。软件行业和学术界尊重其创始人,我们都是开源社区中构建开拓智域文化(homesteads the noosphere)的一部分。 而 Jeremy Howard 本人对此的后续回应是我们创造了第一个“通用语言模型”,但后续论文没有沿用,反而创造了“大型语言模型”这个新术语。 苹果工程师 Nathan Lawrence 认为,虽然今天大家对谁是第一个 LLM 可能存在争议,但最终大家都会把 ULMFiT 视为一个转折点。 当时即使我这样的怀疑论者,也快开始意识到大规模通用训练将成为 NLP 的未来。 也有人建议 Jeremy Howard 以后说 ULMFit 是第一个“通用预训练模型”。 “我发明了 ChatGPT 中的 GP”,这句话说起来也很酷,一点也不夸张。 ULMFit //arxiv.org/abs/1801.06146 GPT-1 //cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf 参考链接: [1]//x.com/jeremyphoward/status/1905763446840607164 [2]//thundergolfer.com/blog/the-first-llm

-
jm天堂
jm天堂也可以被叫做jmcomic,这是为追漫爱好者们打造的免费漫画阅读软件,涵盖众多原创与二创漫画作品,支持对翻页方式与漫画界面主题定制,打造属于自己的追漫天堂。每天同步多个海外漫画站点更新,首页实
精选下载 04-05
-
木兰影院追剧官方版
木兰影院追剧官方免费下载自己喜欢的影片,可以在没有网络的时候畅看自己下载的影片。在木兰影院画质高清不说,加载速度还很快速,可以更快的看到精彩的影片。木兰影院之所以备受欢迎,最重要的原因之一是所有影片都
精选下载 03-10
-
jmcomic.2.0.mic安装包
jmcomic 2 0 mic安装包是一款能够免费阅读各类优质漫画的手机软件,软件中拥有海量的漫画作品,满足每个漫迷不同的阅读需求。软件中拥有强大的漫画搜索功能,输入漫画的名称、主题就能找到所有相关的
精选下载 04-02

-
小游戏秒玩 4
小游戏秒玩也被叫做vivo秒玩小游戏,这是vivo旗下一款主打小游戏的云游戏盒子软件,全国数百款小游戏都能打开秒玩,休闲、竞技、RPG等小游戏中了一应俱全,玩家们最想玩的、最高评分的游戏这里都有。每周
-
retouch 4
retouch是一款专业级别的修图工具,在该工具中打造了多种的p图工具,并且全部都是可以免费使用的,各个工具还搭配了详细的使用教程,让新手小白也可以在这里快速的掌握并进行使用。retouch中的修图工
-
wearos工具箱安装包app是一款实用的工具箱平台,在该平台中汇聚了海量的工具资源,这些工具所具备的功能极为的全面,包括了系统工具、日常工具、办公工具、娱乐工具等等,让用户们日常使用可以极为的便捷。
-
宇宙工具箱最新版 4
宇宙工具箱最新版app是一款专为用户们打造的工具箱平台,在该平台中汇聚的工具资源极为的丰富,用户在使用时只需要根据功能进行搜索,就可以快速的从海量工具中筛选出来。这些工具的使用都是完全免费的,常用的工
-
360个人图书馆 4
360个人图书馆是读者们手机中的万能文库,帮助读者们从互联网上整理出最全的资料文章,小说、文献、笔记等等这里全都能找到,而且平台还将不同的文章按照类型进行筛选,整体的布局更简洁有序,更方便精准查找文档

-
本站 3 月 2 日消息,在目前正在进行的HMD Global巴塞罗那发布会上,HMD 130 Music和HMD 150 Music手机发布,其中 HMD 130 Music提供蓝色、粉色和黑色,而
-
感谢本站网友 GGGZX、软媒新友1944794、七海风、Xr白糖、雨雪载途、软媒新友2479356、软媒用户717377 的线索投递! 本站 3 月 2
-
1 每日免费的抽卡、点金和快速作战千万别错过啦2 每日可在冒险中挑战日常副本、参与各种玩法可获得各种收益3 每日在竞技场给排行榜中的玩家点赞也可获得金币哦4 加入公会,消耗贡献学习公会技能也能让精灵获
-
热门 雕英雄传手游职业gl攻略
雕英雄传手游职业gl攻略《射雕英雄传》手游里这四大职业,保准儿让你心里有谱儿。俺小时候也玩过这游戏,哎呀,那会儿瞎选了个职业,天天被虐,后来才琢磨明白点门道,嘿嘿,算是个教训吧。先说全真教,这家伙远近
-
幸存之地手游暴露行踪生存攻略嗨,小伙伴们!我是CBI游戏天地小编安雅。这段时间我可没闲着,整天泡《幸存之地》里求生存,来跟大家分享下我的心得经验吧!讲真,刚进游戏时把我吓得不轻。第一次遇到僵尸群差点就

- 这就是江湖全职业武道大会 03-07
- 阴阳师初翎山风林间密猎什么时候上线 阴阳师初翎山风林间密猎免费获取方法 03-07
- 魔兽争霸rp是哪个英雄? 03-03
- Dnf冰结哪个流派好 03-03
- 红警和魔兽争霸哪个难 03-05
- 燕云十六声缩骨功奇术怎么获得 燕云十六声缩骨功奇术获取方法 03-03