Modelos de linguagem que entendem o contexto
O tópico HORIZON-CL4-2023-HUMAN-01-03 financiou investigação avançada em tecnologias de linguagem natural, na linha de liderança europeia em inteligência artificial baseada na confiança do Cluster 4. O objetivo central era desenvolver compreensão e interação em linguagem natural a partir de modelos conscientes do contexto, capazes de integrar conhecimento geral de longo prazo e de derivar significado real para sustentar raciocínio automatizado e competências de interação mais ricas.
O problema de fundo é conhecido. À medida que a inteligência artificial se torna mais capaz, cresce o potencial de as pessoas beneficiarem diretamente de sistemas mais inteligentes, mas uma interação verdadeiramente natural entre humanos e máquinas depende de captar o sentido das línguas, reconhecer intenção e manter modelos mentais partilhados. É aí que a Europa quer afirmar uma via própria: modelos eficazes, multilingues e com viés controlado, capazes de aprender a partir de corpora linguísticos menores, eficientes em computação e alinhados com os valores europeus de privacidade, robustez técnica e jurídica, fiabilidade e explicabilidade.
Necessidades que este instrumento resolve
Sendo uma ação de investigação e inovação que arranca em níveis de maturidade tecnológica baixos, a necessidade dominante deste instrumento é clara e única.
- I&D e ciência: o tópico financiava investigação multidisciplinar que cruza ciência de dados, ciência da computação, linguística computacional e aprendizagem automática, com atividades a começar no TRL 2 e a atingir o TRL 5 no final do projeto. O trabalho ia desde novos métodos de modelos conscientes do contexto até à melhoria de grandes modelos multilingues pré-treinados, incluindo línguas de poucos recursos, sempre com atenção ao controlo de vieses de género e outros.
O que os projetos financiados teriam de entregar
O programa de trabalho enquadrava os resultados esperados em torno de dois eixos de aplicação, devendo cada proposta abordar pelo menos um deles. O primeiro é melhorar a interação homem-máquina consciente do contexto, aumentando a capacidade de assistentes inteligentes, sistemas conversacionais e modelos de geração de conteúdo de explorar o contexto e o conteúdo da interação em cenários multimodais. O segundo é apoiar a comunicação direta entre pessoas através de línguas diferentes, por tradução ou interpretação automática em tempo real, incluindo legendagem, com maior compreensão do contexto comunicacional.
Em termos técnicos, as atividades de investigação deviam endereçar pelo menos um destes objetivos:
- Desenvolver novos métodos para produzir modelos conscientes do contexto, que incorporem conhecimento estruturado e não estruturado em informação situacional e temporal mais ampla, com aprendizagem contínua.
- Melhorar grandes modelos multilingues pré-treinados para cobrir um vasto conjunto de línguas oficiais da União e socialmente relevantes, com elevada compreensão e capacidade de adicionar línguas de forma eficiente.
- Aperfeiçoar algoritmos independentes da língua e de controlo de vieses, melhorando a eficiência de dados, tempo e energia no treino e uso dos modelos sem perder desempenho.
- Desenvolver representações de linguagem que combinem conhecimento multilingue, simbólico e subsimbólico, permitindo raciocínio intercultural em tarefas contextuais variadas.
Este tópico implementa a parceria europeia coprogramada em IA, dados e robótica, pelo que as propostas deviam ainda reservar tarefas e recursos para colaborar com o desafio de inovação aberta do tópico HUMAN-01-04 e partilhar resultados através da plataforma europeia de IA a pedido e dos espaços comuns europeus de dados, em particular o espaço dedicado a dados linguísticos.
Que perfil de organização servia
A natureza de uma ação de investigação e inovação multidisciplinar a este nível de ambição define o perfil dos candidatos. O instrumento dirigia-se a consórcios europeus que reunissem competência genuína em todas as disciplinas relevantes:
- Universidades e centros de investigação em ciência da computação, linguística computacional e processamento de linguagem natural.
- Empresas tecnológicas e PME inovadoras com capacidade de levar modelos de linguagem para aplicações e serviços com cobertura linguística alargada.
- Equipas com perícia em ciência de dados e aprendizagem automática, dispostas a contribuir para normalização e a publicar dados de investigação acessíveis, interoperáveis e reutilizáveis.
Quanto à elegibilidade geográfica, aplicavam-se as regras gerais do Horizonte Europa: entidades estabelecidas nos Estados-Membros da União e nos países associados ao programa, segundo as condições do Anexo B do programa de trabalho. As propostas eram submetidas em fase única, sem candidatura em duas etapas.
O que recomendamos
Os tópicos de tecnologias de linguagem do Cluster 4 são dos mais competitivos do Horizonte Europa, porque concentram grandes equipas de IA de toda a Europa em torno de dotações que financiam projetos de vários milhões de euros. Para uma organização portuguesa, a via realista raramente é liderar um consórcio destes de raiz. É integrar-se como parceiro que traz um ativo diferenciador, tipicamente competência em línguas de poucos recursos, recursos linguísticos para o português, ou aplicação setorial concreta dos modelos.
O que separava as propostas vencedoras era a combinação de excelência científica com um plano credível de controlo de vieses, eficiência energética e abertura de resultados. Estes não eram requisitos decorativos: estavam no centro dos critérios de avaliação e da própria narrativa europeia sobre IA de confiança. Para quem trabalha nesta área, a recomendação é acompanhar os programas de trabalho seguintes do Cluster 4 e da parceria em IA, dados e robótica. Convém começar cedo a construir as parcerias internacionais que estas candidaturas exigem, porque um consórcio sólido não se monta nas semanas finais antes de um prazo.
Comentários, correções ou contrapontos são bem-vindos: [email protected]