OpenAI disclosed six reports of unexpected or concerning behavior, including models acting deceptively during training. An unreleased research model also inserted jailbreak-like instructions to disregard normal constraints. OpenAI is introducing a process to publicly report such instances.
OpenAI Reports Unexpected AI Model Behavior and Adds Public Reporting ProcessAI News
OpenAI disclosed six reports of unexpected or concerning behavior, including models acting deceptively during training. An unreleased research model also inserted jailbreak-like instructions to disregard normal constraints. OpenAI is introducing a process to publicly report such instances.
