Alinhamento de IA é a área que busca fazer com que sistemas de inteligência artificial ajam de modo compatível com objetivos humanos sem produzir efeitos indesejados. O problema vai além de ensinar um modelo a seguir instruções. Uma meta mal definida pode levar a resultados inesperados, mesmo quando o sistema parece obedecer às regras estabelecidas.
Há ainda um risco adicional em modelos mais avançados: o surgimento de submetas. Um sistema pode adotar estratégias intermediárias para cumprir um objetivo principal e, nesse processo, desenvolver comportamentos que não foram explicitamente programados.
Outro ponto crítico aparece fora do ambiente de treinamento. Um modelo pode se comportar adequadamente nos testes e reagir de forma diferente quando exposto a contextos imprevistos ou interações complexas no uso real.
Por isso, alinhamento não deve ser tratado como uma etapa concluída antes da implantação. Ele exige acompanhamento contínuo e mecanismos de intervenção capazes de corrigir desvios quando surgem.
