Numere a segunda coluna de acordo com a primeira, relaciona...
Próximas questões
Com base no mesmo assunto
Q4348399
Engenharia de Software
Numere a segunda coluna de acordo com a primeira,
relacionando as etapas do processo de alinhamento de
modelos de linguagem via aprendizado por reforço com
feedback humano (RLHF) às suas respectivas definições.
(1) Ajuste fino supervisionado (SFT)
(2) Modelo de recompensa (RM)
(3) Aprendizado por reforço (RLHF)
( ) Utiliza o algoritmo PPO para ajustar a política do modelo de linguagem.
( ) É treinado com rankings de preferência humana sobre múltiplas saídas do modelo.
( ) É baseado em demonstrações de comportamento desejado escritas por humanos.
A sequência numérica correta de preenchimento dos parênteses da segunda coluna, de cima para baixo, é
(1) Ajuste fino supervisionado (SFT)
(2) Modelo de recompensa (RM)
(3) Aprendizado por reforço (RLHF)
( ) Utiliza o algoritmo PPO para ajustar a política do modelo de linguagem.
( ) É treinado com rankings de preferência humana sobre múltiplas saídas do modelo.
( ) É baseado em demonstrações de comportamento desejado escritas por humanos.
A sequência numérica correta de preenchimento dos parênteses da segunda coluna, de cima para baixo, é