About the position
Context
Le service Information et Édition Scientifiques (IES) relève de la Direction de la culture et de l’information scientifiques (DCIS) – elle-même rattachée à la Direction générale déléguée à la science (DGD-S). Il assure le soutien des activités scientifiques, en s’appuyant sur six pôles d’activités :
Acquisitions numériques
Archives ouvertes
Edition scientifique
IES pour la Médiation scientifique
Services à l’usager
Données de la recherche.
Ce poste est positionné au sein de la DCIS et sera encadré par Alain Monteil et Kumar Guha
Dans le cadre du projet AIKO (AI for scientists: publication KnOwledge), piloté par Inria dans sa mission d’Agence de programmes et le CIRAD, nous recrutons pour une durée d’un an, un/e expert/e en en ingénierie des systèmes d’information et réseaux. Ce poste est centré sur les communs logiciels et les outils opérationnels à déployer dans les établissements, pour alimenter une infrastructure de recherche sur les publications scientifiques. Cette mission devra se poursuivre dans le cadre d’une collaboration avec l’INIST-CNRS.
Assignment
Reprendre la chaine de traitement existante qui moissonne les publications déposées sur HAL pour en faire des versions TEI normalisées avec l’Outil GROBID et les traitements avec les applications comme SoftCite, Biblio-Glouton et Datastet comme enrichissement. Il faudra mener une opération de reprise de codes développés lors de précédents projets pour en assurer la pérennité et la portabilité au sein de l’infrastructure ISTEX.
Analyser des sources internes et externes pertinentes pour le projet : analyse du contenu, de la qualité des données, du potentiel d’enrichissement de la base HAL, des modalités de cet enrichissement.
Le candidat aura à animer les personnes impliquées dans le projet (INRIA et INIST-CNRS) et devra agir avec une certaine autonomie rapidement.
Enfin il/elle devra prendre en compte le passage en production à large échelle et volumétrie (processus en parallèle, etc.).
Main activities
Production de versions nettoyées (sérialisation, tokenisation, filtrage par langue) pour fournir des corpus directement utili
sables pour l’entraînement de LLMs et autres modèles d’IA. Une collaboration devra se mettre en place avec le DFKI (Sarrebruck, DE) qui a déjà travaillé sur les outils correspondants (https://github.com/scilons) pour des contenus issus de Unpaywall ;
Mise en place d’une base bibliographique de citations désambiguïsées sur la base de l’outil biblio-glutton (https://github.com/kermitt2/biblio-glutton) qui combine les références bibliographiques sur la base des informations issues du portail CrossRef, mais aussi des entrées de HAL. Ce travail peut servir de base pour créer un graphe de citation solide à la disposition de la communauté scientifique ;
Repérage de sections spécifiques dans les documents, comme par exemple les financeurs dans le cadre des travaux déjà menés par le CCSD et qui pourront permettre d’expérimenter par exemple les tendances scientifiques liées aux financements ANR
Repérage massif des mentions faites à des logiciels et des jeux de données, sur la base des composants open source SoftCite et Datastet, déjà utilisés pour le baromètre de la science ouverte. Ces données serviront directement aux travaux des scientifiques.
Skills
Savoir :
Backend Developer expérimenté(e)
Expérience avec un langage backend (Python, Node.js, Java, etc.).
Connaissance des protocoles HTTP et des API REST
COAR Notify (protocole de notification entre entrepôts).
OAI-PMH (Open Archives Initiative Protocol for Metadata Harvesting).
Protocoles d'interopérabilité (ex : SWORD, OAI-ORE).
La connaissance du protocole S3 (Simple Storage Service) serait un plus.
La conception et l'optimisation de bases de données type ArangoDB ou similaire.
Expérience avec ArangoDB (AQL, indexation).
La conteneurisation des applications avec Docker.
Maîtrise de Docker (Dockerfile, Docker Compose).
Le déploiement et la maintenance d'environnements cloud.
Maîtrise de XML et XML-TEI et des normes associées.
Machine learning
Grand Modèle de Langage (LLM)
Connaissance en architecture réseau et virtualisation ?
Connaissances en modèles et standards pour la représentation de données bibliographiques et/ou textuelles.
Maîtrise d’un ou plusieurs langages de programmation permettant la manipulation de données (Python, R, XSLT)
Maîtrise de l’anglais écrit, et si possible oral.
Méthodologie de conduite de projet en particulier en mode AGILE
Savoir Faire
Appliquer les techniques du domaine
Rédiger des contenus adaptés aux publics
Utiliser les logiciels spécifiques à l'activité
Utiliser les outils bureautiques
Communiquer et faire preuve de pédagogie
Savoir être
Faire preuve de rigueur et de méthode
Avoir l’esprit d’équipe
Avoir le sens de la communication
Avoir un bon esprit d’analyse
Faire preuve de curiosité
This listing was collected from a public source and is reproduced here for
information only. Always confirm the details on the original posting before applying.
View the original posting