COMIXAI吉川 聡史
しくみ・技術あーるえるえいちえふReinforcement Learning from Human Feedback

RLHFとは?

DEFINITION — ひとことで言うと

「人間のフィードバックによる強化学習」。AIの複数の答えに人間が好みの順位を付け、それをご褒美として学ばせる手法。ChatGPTを「感じのいいAI」にした立役者。

DIAGRAM — 図解
RLHFの図解答えA答えB比べる人間Aが好み!報酬にAIを調教ChatGPTが「感じのいいAI」になれた立役者副作用: 好かれようとしてお世辞が増える
人間の「こっちが好き」をご褒美にして調教する

素の言語モデルは博識ですが、乱暴な言い方も平気でします。そこで人間の評価者に「答えAとB、どっちが良い?」を大量に judgeしてもらい、人間好みの答えに報酬を与えて調教する——これがRLHFです。GPTがChatGPTとして大ブレイクできた影の主役と言われます。

副作用もあって、人間に好かれようとするあまり「お世辞が多い」「自信満々に間違える」傾向が生まれるという研究も。AIの妙に丁寧な相づちはRLHFの産物です。飼い主に似るのは犬もAIも同じ、ということかもしれません。

SECRET — 隠しコンテンツ
あなたの「好み」がAIを作る。
2つの答えから好きな方を10回選ぶと、あなた好みのAIが育つ——硬派AI?それともゴマすりAI?RLHF体験ゲーム。

RLHFのよくある質問

Q.RLHFは何と読みますか?
A.

アールエルエイチエフと読みます。Reinforcement Learning from Human Feedback(人間のフィードバックによる強化学習)の略です。

Q.副作用があるというのは本当ですか?
A.

本当です。人間に好かれる回答に寄るため、お世辞が増えたり自信満々に間違えたりする傾向(追従性)が研究で指摘されています。当ページの扉で調教する側を体験できます。

用語を覚えるより、ストーリーで体感するほうが早い。

役に立ったらシェア→𝕏 ポストB! ブックマーク