Archives par étiquette : indexation

Agrotagger: indexation automatique de PDFs avec le thesaurus Agrovoc

Le site  Agrotagger 2.0 en version bêta (démonstration) permet de « tagger » ou d’indexer automatiquement, en anglais, vos documents en PDF ou en format Word à l’aide du thesaurus Agrovoc de la FAO. Il utilise un extracteur de terme KEA (qui semble un peu ancien). Les résultats (mots-clés) sont présentés  sous la forme de triplets RDF avec des renvois dans Agrovoc et un nuage de tags des mots clés.
http://agrovoc.mimos.my:58301/AgroTagger/

Voici une démonstration sur le PDF de l’article : Laurent Bréhélin L.; Gascuel O.; Martin O. (2008) Using repeated measurements to validate hierarchical gene clusters. Bioinformatics 24 (5): 682-688. doi : 10.1093/bioinformatics/btn017. Les mots clés trouvés sont les suivants :

Tags Agrovoc URIs
genes http://aims.fao.org/aos/agrovoc/c_27532
gene expression http://aims.fao.org/aos/agrovoc/c_27527
Bioinformatics http://aims.fao.org/aos/agrovoc/c_37958
Animal husbandry http://aims.fao.org/aos/agrovoc/c_25746
genomes http://aims.fao.org/aos/agrovoc/c_3224
Cell differentiation http://aims.fao.org/aos/agrovoc/c_2265
operations research http://aims.fao.org/aos/agrovoc/c_5364
Experimental design http://aims.fao.org/aos/agrovoc/c_29466
transcription http://aims.fao.org/aos/agrovoc/c_35127
Sampling http://aims.fao.org/aos/agrovoc/c_6774

Un autre service est développé  par la FAO dans le cadre du projet agINFRA, utilisant le Framework d’indexation Maui. Une version de test est disponible :  http://maui-indexer.appspot.com/

Le résultat sur le même article est le suivant

Input document : Vol. 24 no. 5 2008, pages 682–688 BIOINFORMATICS doi:10.1093/bioinformatics/btn017 Gene expression Using repeated measurements to validate hierarchical gene clusters.

Source : voir http://aims.fao.org/agrotagger

Publier pour le web des données et le faire savoir

Comme pour le web des documents, l’indexation des données publiées dans le web des données est importante. Il existe deux approches pour référencer ses données dans le web des données:

  1. créer un fichier VoID (Vocabulary for Interlinked Dataset) et le déclarer sur les principaux moteurs de recherche sémantiques tels que Sindice. Un tel fichier permet de décrire le contenu d’un ensemble de données (informations de base, informations utiles, licences, sujets), les services associés à cet ensemble de données, et l’organisation du contenu (en sous ensembles de données notamment)
  2. créer un sitemap sémantique et le référencer sur les principaux moteurs de recherche sémantiques.

Lisez l’article qui se trouve ici si vous souhaitez savoir comment créer en pratique un fichier VoID et un sitemap sémantique et comment les déclarer sur les moteurs de recherche sémantiques.