O Google acaba de apresentar novos detalhes do Android Bench 2.0, trazendo uma proposta reformulada para medir como a inteligência artificial lida com tarefas de desenvolvimento de software mais complexas e de longo prazo.
Diferente da primeira versão, que focava em pequenas alterações e correções de bugs, a nova edição exige dos modelos a execução de projetos que levariam dias ou até mesmo semanas para um engenheiro de software humano concluir, como criar um app do zero e converter aplicações multiplataforma.
Para acompanhar a mudança, o Google também traz um novo sistema de avaliação: em vez de uma pontuação binária (passou ou não), agora a nota leva em consideração a taxa de conclusão, avaliando fatores como funcionalidade, fidelidade visual e prevenção de regressões, aplicando penalidades para desvios das instruções ou restrições estruturais.
