Qwen3-4B modelida model og'irliklarini o'zgartirmasdan rad etish javoblarini bloklash usuli taqdim etildi
Ochiq kodli sun'iy intellekt modellarida rad etish mexanizmini o'chirish odatda uning og'irliklarini doimiy o'zgartirishni talab qiladi. Biroq bu yondashuv modelning boshqa umumiy vazifalarni bajarish unumdorligini pasaytirishi mumkin.
Tadqiqotchilar Qwen3-4B modelida Engram va ko'p qatlamli yo'naltirish orqali Dynamic Abliteration usulini namoyish etishdi. Ushbu yondashuv PyTorch ilmoqlari yordamida model og'irliklarini to'liq muzlatgan holda rad etish xatti-harakatlarini samarali to'xtatadi.
24.09.2026, 21:01 · Manba: Madhukaraphatak
Fikr bildiring va muhokamaga qo'shiling