Reaction---跟着李沐学AI(InstructGPT 论文精读【论文精读·48】)
当年入门 AI research 的圣经之一,如果你想要深入地了解 AI 领域的一些新技术,李沐的这个 论文精读系列可以说是当时网络上最好的资料了,当然放到现在来看可能有点过时了。最近闲来无事,想起来自己当年一直想要给他看完,但是总是看到后面不知道怎么就没继续了,打算从上次断的的地方继续,于是有了这篇 Reaction。
距离这个视频的发布差不多已经有 4 年,距离 InstructGPT 的发布已经四年多了,每一次回顾 AI 的历史,或者 LLM 的历史总是令人不由得感慨这个领域发展之迅速、变化之惊人。四年前别说 InstructGPT,就算是后面的 ChatGPT 也不过是一个惊艳的小玩具,感觉大部分人,至少我从来没想到仅仅只用不到四年,AI 就能发展成今天的地步,已经深度融入到千万计乃至上亿人的生活里了。
anthropic
alignment,公关方面的问题,当年 openai 的好处
jailbreak
fine-tuning with human feedback(SFT)、RL with human feedback(RLHF)
数据标注
下一篇就是 anthropic,然后讲的可能是 2023 年年初的时候,现在回头去看,全是 big name,但是呢,2023 年,真的很少有人知道 Claude。
主要还是数据
All articles on this blog are licensed under CC BY-NC-SA 4.0 unless otherwise stated.
Comments
GiscusUtterances