
LLM alignment and post-training
یادگیری تقویتی از بازخورد انسانی یا RLHF یکی از مهمترین روشهایی است که برای تبدیل یک مدل زبانی قدرتمند به یک سامانه هوش مصنوعی مفید، قابل کنترل و هماهنگ با ترجیحات انسانها استفاده میشود. این کتاب تصویری جامع از چیستی RLHF، نحوه پیاده سازی آن، دلایل استفاده از آن و جایگاهش در مجموعه روشهای مدرن آموزش پس از پیشآموزش ارائه میدهد.
RLHF حوزهای میان رشتهای است که مفاهیم متعددی از یادگیری تقویتی، یادگیری ماشین، نظریه، مهندسی نرم افزار، داده، فلسفه، تجربه کاربری، طراحی محصول و تعامل انسان و هوش مصنوعی را در کنار یکدیگر قرار میدهد. به همین دلیل، درک واقعی آن تنها با مطالعه یک الگوریتم یا یک روش آموزشی خاص به دست نمیآید.
این کتاب تلاش میکند تمام اجزای مهم این فرایند را در یک تصویر واحد کنار هم قرار دهد؛ از آموزش اولیه مدل برای پاسخ گویی به دستورها گرفته تا ساخت مدل پاداش، بهینه سازی با یادگیری تقویتی، جمع آوری ترجیحات انسانی، استفاده از داده مصنوعی، ارزیابی مدل و در نهایت تأثیر این فرایند بر رفتار و شخصیت مدل در محصول نهایی.
هدف کتاب ارائه یک دانشنامه سنگین و جامع دانشگاهی نیست؛ بلکه ایجاد یک مرجع سریع، دقیق و کاربردی برای ورود به حوزه RLHF و فراهم کردن دانش لازم برای ساخت یک پیاده سازی آزمایشی یا مطالعه عمیق تر مقالات تخصصی است.
مدل های زبانی بزرگ پیش از مرحله آموزش پس از پیشآموزش، عمدتاً با حجم عظیمی از داده ها آموزش می بینند تا بتوانند الگوهای زبان و اطلاعات موجود در متن را یاد بگیرند. اما توانایی پیش بینی متن به تنهایی به معنای توانایی پاسخ گویی مطلوب به انسان نیست.
یک مدل ممکن است از نظر زبانی بسیار قدرتمند باشد، اما پاسخ هایی تولید کند که طولانی، نامرتبط، نادرست، نامناسب یا ناسازگار با خواسته کاربر هستند. آموزش پس از پیشآموزش تلاش می کند این فاصله را کاهش دهد.
RLHF یکی از مهم ترین رویکردهای این مرحله است. در این روش، رفتار مطلوب مدل با استفاده از بازخورد و ترجیحات انسانی مشخص می شود و سپس مدل به سمت تولید پاسخ هایی هدایت می شود که با این ترجیحات سازگاری بیشتری دارند.
درک این فرایند برای کسانی که می خواهند بدانند مدل هایی مانند دستیارهای هوش مصنوعی چگونه از یک مدل زبانی خام به سامانه ای تعاملی و کاربردی تبدیل می شوند، اهمیت بسیار زیادی دارد.
یکی از ویژگی های اصلی RLHF این است که نمی توان آن را صرفاً یک مسئله مربوط به یادگیری تقویتی دانست.
در یک فرایند واقعی، پرسش های متعددی مطرح می شوند:
انسان ها همیشه درباره بهترین پاسخ توافق ندارند. ممکن است یک پاسخ از نظر یک ارزیاب دقیق تر باشد و از نظر ارزیاب دیگر مفیدتر یا خواناتر.
بازخورد انسان باید جمع آوری، ساختاربندی و پالایش شود تا بتوان از آن برای آموزش مدل استفاده کرد.
کلمات کلیدی:مدل نمی تواند مستقیماً «نظر انسان» را درک کند. باید روشی طراحی شود که این ترجیحات را به یک سیگنال قابل استفاده برای بهینه سازی تبدیل کند.
اگر مدل بیش از اندازه برای یک معیار مشخص بهینه شود، ممکن است راه هایی پیدا کند که امتیاز بالاتری بگیرد اما واقعاً رفتار مطلوبی نداشته باشد. این مسئله به هک کردن پاداش و مشکل پاداش جانشین مربوط می شود.
افزایش امتیاز در یک معیار خاص لزوماً به معنای بهتر شدن کلی مدل نیست. به همین دلیل ارزیابی و طراحی معیارهای مناسب بخش جدایی ناپذیر RLHF است.
این کتاب دقیقاً در نقطه اتصال این مسائل قرار می گیرد.
یکی از مفاهیم مهم کتاب، درک مسیر کلی تبدیل یک مدل زبانی به مدلی است که بتواند به شکل مناسب تری با انسان تعامل کند.
در رویکرد کلاسیک RLHF، این مسیر را می توان به سه مرحله اصلی تقسیم کرد:
در مرحله نخست، مدل با داده هایی آموزش داده می شود که ساختار پرسش و پاسخ یا دستور و پاسخ دارند.
هدف این مرحله آن است که مدل یاد بگیرد چگونه به دستورهای انسان پاسخ دهد و از حالت صرفاً پیش بینی کننده متن به مدلی مناسب تر برای تعامل مستقیم تبدیل شود.
در مرحله دوم، مدلی آموزش داده می شود که بتواند ترجیحات انسانی را تقریب بزند.
برای مثال، اگر چند پاسخ برای یک پرسش وجود داشته باشد، ارزیاب انسانی می تواند مشخص کند کدام پاسخ مطلوب تر است. این اطلاعات برای آموزش مدلی استفاده می شود که بتواند کیفیت نسبی پاسخ ها را تخمین بزند.
در مرحله سوم، مدل زبانی با استفاده از سیگنال مدل پاداش بهینه می شود.
مدل تلاش می کند پاسخ هایی تولید کند که پاداش بیشتری دریافت کنند، در حالی که روش های کنترلی نیز برای جلوگیری از فاصله گرفتن بیش از حد از مدل پایه مورد استفاده قرار می گیرند.
این سه مرحله یکی از ستون های اصلی درک RLHF کلاسیک هستند و کتاب هر بخش را به شکلی هدفمند بررسی می کند.
RLHF تنها روش موجود برای آموزش پس از پیشآموزش نیست. با رشد مدل های زبانی بزرگ، روش های جدیدتر و ساده تری نیز توسعه پیدا کرده اند.
کتاب علاوه بر RLHF کلاسیک، روش هایی مانند یادگیری تقویتی با پاداش قابل راستی آزمایی، الگوریتم های هم ترازسازی مستقیم، بهینه سازی مستقیم ترجیحات و نمونه برداری پس از رد را بررسی می کند.
این رویکرد گسترده باعث می شود خواننده RLHF را در یک چارچوب بزرگ تر ببیند و متوجه شود که چرا برخی روش ها پیچیدگی کمتری دارند و چگونه ادبیات جدید آموزش پس از پیشآموزش شکل گرفته است.
در برخی مسائل، امکان تعریف معیارهایی وجود دارد که بتوان نتیجه را به شکل نسبتاً عینی بررسی کرد.
این ایده در یادگیری تقویتی با پاداش قابل راستی آزمایی اهمیت پیدا می کند و به ویژه در زمینه استدلال و مسئله هایی که پاسخ درست یا قابل بررسی دارند، کاربرد دارد.
کتاب این رویکرد را در کنار RLHF قرار می دهد تا خواننده تفاوت میان بازخورد مبتنی بر ترجیحات انسانی و پاداش هایی که می توان مستقیماً راستی آزمایی کرد را بهتر درک کند.
یکی از تحولات مهم در حوزه آموزش مدل های زبانی، ظهور روش هایی است که می توانند بدون اجرای کامل فرایند کلاسیک یادگیری تقویتی، از داده های ترجیحی استفاده کنند.
بهینه سازی مستقیم ترجیحات از مهم ترین نمونه های این خانواده است.
این روش ها باعث شده اند ورود پژوهشگران و مهندسان بیشتری به حوزه هم ترازسازی مدل ها ساده تر شود و مطالعه آن ها برای درک وضعیت مدرن آموزش پس از پیشآموزش اهمیت ویژه ای داشته باشد.
روش دیگری که کتاب بررسی می کند، نمونه برداری پس از رد است؛ رویکردی که می تواند برای انتخاب پاسخ های مناسب تر از میان خروجی های تولیدشده توسط مدل استفاده شود.
این ایده در توسعه برخی مدل های مهم نیز مورد استفاده قرار گرفته و نمونه ای از روش هایی است که می توانند نسبت به فرایند کامل RLHF ساده تر باشند.
هیچ روش آموزش پس از پیشآموزشی بدون داده مناسب نمی تواند عملکرد مطلوبی داشته باشد.
یکی از بخش های مهم کتاب به این پرسش اختصاص دارد که اصلاً ترجیح انسانی چیست و چرا باید برای آموزش مدل اهمیت داشته باشد؟
این موضوع بسیار عمیق تر از انتخاب ساده یک پاسخ از میان دو پاسخ است.
انسان ها بر اساس مجموعه ای از عوامل پاسخ ها را ارزیابی می کنند؛ از جمله:
میزان مفید بودن
دقت
ارتباط با پرسش
وضوح
سبک پاسخ
ایمنی
کامل بودن
رعایت دستور کاربر
تناسب با زمینه
اما این معیارها همیشه مستقل و کاملاً قابل اندازه گیری نیستند.
به همین دلیل، داده ترجیحات انسانی خود یک مسئله مهم پژوهشی و مهندسی است.
کتاب فرایند جمع آوری و پالایش داده های ترجیحی را بررسی می کند و نشان می دهد که داده چگونه وارد زنجیره آموزش مدل می شود.
این بخش برای درک محدودیت های RLHF بسیار مهم است؛ زیرا کیفیت داده های انسانی می تواند مستقیماً بر رفتار مدل اثر بگذارد.
با بزرگ تر شدن مدل ها و افزایش هزینه جمع آوری داده انسانی، داده تولیدشده توسط مدل های هوش مصنوعی اهمیت بیشتری پیدا کرده است.
کتاب به تولید داده مصنوعی و نقش آن در فرایندهای مدرن آموزش می پردازد.
همچنین مفهوم هوش مصنوعی قانون اساسی را بررسی می کند؛ روشی که در آن مجموعه ای از اصول و قواعد برای هدایت مدل مورد استفاده قرار می گیرد و مدل می تواند در فرایند ایجاد بازخورد نقش داشته باشد.
مدل های زبانی به طور طبیعی با محدودیت هایی مواجه هستند. وزن های مدل ایستا هستند و مدل به خودی خود نمی تواند همیشه اطلاعات بیرونی یا قابلیت های محاسباتی مورد نیاز را در اختیار داشته باشد.
یکی از راه های حل این مشکل، آموزش مدل برای تعامل با ابزارها و رابط های برنامه نویسی کاربردی است.
کتاب به آموزش استفاده از ابزار و فراخوانی تابع می پردازد و توضیح می دهد که چگونه مدل ها می توانند برای حل مسائل پیچیده تر با سامانه های بیرونی تعامل داشته باشند.
این موضوع ارتباط مستقیمی با نسل جدید دستیارهای هوش مصنوعی و سامانه های عامل محور دارد.
یکی از عمیق ترین چالش های RLHF این است که مدل پاداش در واقع خودِ هدف نیست؛ بلکه تنها یک تقریب از ترجیحات انسانی است.
اگر مدل بیش از اندازه برای افزایش امتیاز مدل پاداش بهینه شود، ممکن است رفتاری پیدا کند که امتیاز بالایی می گیرد اما از دید انسان واقعاً مطلوب نیست.
این مسئله را می توان به عنوان نوعی هک کردن پاداش در نظر گرفت.
کتاب بررسی می کند که چرا این مشکل به طور کامل قابل حذف نیست و چرا طراحی و استفاده از پاداش جانشین نیازمند احتیاط فراوان است.
برای کنترل فرایند بهینه سازی، روش های منظم سازی اهمیت زیادی دارند.
یکی از مهم ترین تکنیک های مورد بررسی کتاب، استفاده از جریمه کولبک ـ لایبلر است.
ایده کلی این است که مدل در عین حرکت به سمت رفتار مطلوب تر، بیش از اندازه از مدل اولیه خود فاصله نگیرد.
این مفهوم برای درک بسیاری از پیاده سازی های یادگیری تقویتی در مدل های زبانی ضروری است.
یکی از مهم ترین پرسش ها پس از آموزش مدل این است:
آیا مدل واقعاً بهتر شده است؟
پاسخ دادن به این سؤال ساده نیست.
ممکن است مدلی در یک آزمون عملکرد بهتری داشته باشد اما در استفاده واقعی افت کند. همچنین ممکن است یک معیار خاص تنها بخشی از رفتار مدل را اندازه گیری کند.
کتاب چشم انداز در حال تغییر معیارها، آزمون های استاندارد و روش های ارزیابی مدل های پس از آموزش را بررسی می کند و اهمیت ارزیابی چندجانبه را نشان می دهد.
RLHF فقط یک فرایند فنی در پشت صحنه نیست.
نتیجه آن مستقیماً در چیزی دیده می شود که کاربر با آن تعامل دارد.
لحن پاسخ، میزان همکاری، شخصیت، رفتار، نحوه دنبال کردن دستورها و حتی برداشت کاربر از شخصیت یک مدل می تواند تحت تأثیر فرایند آموزش پس از پیشآموزش قرار بگیرد.
به همین دلیل، آخرین بخش کتاب به ارتباط میان RLHF، محصول، تجربه کاربری و شخصیت مدل می پردازد.
آزمایشگاه های هوش مصنوعی باید تصمیم بگیرند که مدل آن ها برای چه محصولی ساخته شده و چه نوع رفتاری با کاربران آن محصول مناسب تر است.
این موضوع نشان می دهد که هم ترازسازی مدل تنها مسئله ای الگوریتمی نیست؛ بلکه بخشی از طراحی محصول هوش مصنوعی است.
کتاب در چهار محور اصلی سازمان دهی شده است:
بخش نخست، تصویری کلی از RLHF ارائه می دهد و توضیح می دهد چرا این روش به وجود آمده و چه تأثیری بر رفتار مدل ها دارد.
همچنین مروری کوتاه بر پژوهش های مهمی ارائه می شود که مسیر پیشرفت علمی منتهی به مدل های گفت وگومحور مدرن را شکل داده اند.
در بخش دوم، روش های فنی اصلی بررسی می شوند:
مبانی یادگیری تقویتی
آموزش تنظیم دستوری
مدل پاداش
بهینه سازی با یادگیری تقویتی
یادگیری تقویتی با پاداش قابل راستی آزمایی
الگوریتم های هم ترازسازی مستقیم
بهینه سازی مستقیم ترجیحات
نمونه برداری پس از رد
بخش سوم بر داده تمرکز دارد:
مفهوم ترجیحات
اهمیت ترجیحات انسانی
جمع آوری داده
پالایش داده
داده مصنوعی
هوش مصنوعی قانون اساسی
بخش پایانی مسائل مهمی را بررسی می کند که در سراسر خط لوله آموزش حضور دارند:
استفاده از ابزار
فراخوانی تابع
بهینه سازی بیش از حد
هک کردن پاداش
منظم سازی
جریمه کولبک ـ لایبلر
ارزیابی
محصول
تجربه کاربری
شخصیت و رفتار مدل
این کتاب برای افرادی نوشته شده که دانش مقدماتی در زمینه مدل سازی زبان، یادگیری تقویتی و یادگیری ماشین دارند و می خواهند وارد حوزه RLHF شوند.
مخاطبان اصلی می توانند شامل گروه های زیر باشند:
اگر با یادگیری ماشین و مدل های زبانی آشنا هستید و می خواهید ادبیات RLHF را بهتر دنبال کنید، این کتاب یک نقطه شروع مناسب فراهم می کند.
برای مهندسانی که قصد دارند با آموزش پس از پیشآموزش، مدل های زبانی بزرگ و هم ترازسازی مدل ها کار کنند، شناخت ساختار کامل RLHF اهمیت زیادی دارد.
کسانی که روی مدل های زبانی بزرگ و رفتار آن ها کار می کنند، می توانند از کتاب برای ایجاد یک دید کلی از روش های مختلف آموزش پس از پیشآموزش استفاده کنند.
درک اینکه مدل های هوش مصنوعی مولد چگونه از بازخورد انسانی استفاده می کنند، برای شناخت محدودیت ها و توانایی های نسل جدید مدل ها ضروری است.
اگر قصد دارید مقالات مرتبط با RLHF را مطالعه کنید، کتاب می تواند دانش پایه مورد نیاز را در اختیار شما قرار دهد و مسیر مطالعه منابع علمی را کوتاه تر کند.
یکی از ویژگی های مهم این کتاب، تأکید آن بر این نکته است که نباید یک نتیجه پژوهشی منفرد را حقیقت قطعی در نظر گرفت.
RLHF حوزه ای است که با سرعت زیادی در حال تغییر است و نتایج پژوهشی گاهی به دلیل تفاوت داده، مدل، روش آزمایش و شرایط اجرا به سادگی قابل تکرار نیستند.
به همین دلیل، کتاب منابع علمی متعددی را معرفی می کند تا خواننده بتواند درباره هر موضوع، چندین پژوهش را مطالعه و مقایسه کند.
در بعضی موارد حتی دیدگاه های متفاوت درباره بهترین روش اجرای RLHF ارائه می شوند.
این رویکرد واقع گرایانه یکی از نقاط قوت کتاب است: در حوزه ای که هنوز بسیاری از پرسش ها پاسخ قطعی ندارند، نشان دادن اختلاف نظرها خود بخشی از یادگیری است.
RLHF تنها مجموعه ای از مفاهیم نظری نیست.
کتاب تلاش می کند خواننده را تا جایی پیش ببرد که بتواند یک پیاده سازی ساده و آزمایشی از روش های اصلی را درک و دنبال کند.
برای همین، در کنار توضیح مفاهیم، انگیزه پشت روش ها و شهود مربوط به عملکرد آن ها نیز مورد توجه قرار گرفته است.
سه پیوست کتاب نیز برای مراجعه عمیق تر طراحی شده اند:
تعریف های ریاضی مربوط به یادگیری تقویتی، مدل سازی زبان و مفاهیم بنیادی دیگر در این بخش گردآوری شده اند.
این بخش منابع و مفاهیم تکمیلی مرتبط با موضوعات مطرح شده در کتاب را در اختیار خواننده قرار می دهد.
مسائل و چالش هایی که هنگام آموزش واقعی مدل ها ممکن است ایجاد شوند، در این بخش بررسی می شوند.
مدل های زبانی بزرگ از مرحله ای که تنها مسئله اصلی «بزرگ تر کردن مدل» بود فاصله گرفته اند.
امروزه کیفیت یک سامانه هوش مصنوعی فقط به تعداد پارامترها یا حجم داده پیشآموزشی آن وابسته نیست. چگونگی آموزش مدل برای استدلال، پیروی از دستورها، تعامل با انسان، استفاده از ابزارها و انتخاب رفتار مناسب نیز اهمیت بسیار زیادی دارد.
به همین دلیل، آموزش پس از پیشآموزش و روش هایی مانند RLHF به یکی از بخش های کلیدی توسعه مدل های مدرن تبدیل شده اند.
این کتاب به جای تمرکز روی یک الگوریتم خاص، تلاش می کند نقشه ای از کل این حوزه ارائه دهد؛ نقشه ای که ارتباط میان مدل، داده، ترجیح انسانی، پاداش، یادگیری تقویتی، ارزیابی و محصول را روشن می کند.
یادگیری تقویتی از بازخورد انسانی یکی از مهم ترین مفاهیم برای درک نحوه تبدیل مدل های زبانی بزرگ به سامانه های هوش مصنوعی تعاملی و کاربردی است.
این کتاب با پوشش مبانی RLHF، تاریخچه شکل گیری آن، یادگیری تقویتی، آموزش تنظیم دستوری، مدل های پاداش، داده های ترجیحی، الگوریتم های هم ترازسازی مستقیم، داده مصنوعی، هوش مصنوعی قانون اساسی، استفاده از ابزار، هک کردن پاداش، منظم سازی و ارزیابی، یک نمای کلی و در عین حال فنی از این حوزه ارائه می دهد.
اگر هدف شما ورود جدی به پژوهش و مهندسی مدل های زبانی بزرگ، یادگیری روش های آموزش پس از پیشآموزش یا مطالعه مقالات RLHF است، این کتاب می تواند یک مرجع شروع کاربردی و فشرده باشد.
نمونه چاپ کتاب موجود نیست.
نظرات کاربران (0)