Les petites cases

Retour sur Freebase à la lumière du Web of data

Au mois de mars, Tim O'Reilly repris par Internet Actu définissait ainsi le but de Freebase : « Créer les synapses du cerveau global ». On y voyait les prémices de la première application concrète et accessible à tous du Web sémantique. Six mois plus tard, je vous propose d'y revenir, alors que le concept de Web of data et Dbpedia ont fait leur apparition.

Dans l'article d'Internet actu, Hubert citait Denny Vrandecic, concepteur de Semantic Mediawiki :

« Metaweb [nda : le concepteur de Freebase et par extension le logiciel qui fait tourner freebase] vient du monde des données structurées, même si la structure est ici flexible et changeante. Semantic Media Wiki vient du monde des données non structurées, qui peuvent être améliorées par quelques éléments de structure pour mettre en relation plusieurs éléments non structurés. ».

Cette analyse me paraît excellente, car elle pose tous les enjeux de Freebase et son mode de fonctionnement. Si on voulait caricaturer, je dirais que Freebase est un wiki structuré OU une base de données dont la modélisation peut changer à la demande de l'utilisateur qui peut librement saisir les données. Choisissez votre camp en fonction de votre origine : données non structurées ou données structurées.

Concrètement, Freebase est organisée sous la forme d'une taxonomie thématique (arts et divertissements, Société, Sport...). Chaque thème comprend des types de ressource (film, acteur, opera, pièce de théâtre, Personne, ville...) auxquels sont rattachés des propriétés. Ces propriétés peuvent relier une ressource à une autre ressource ou à une donnée typée (chaîne de caractères, date, nombre entier...). Si vous suivez ce blog attentivement, vous aurez reconnu le principe d'une ontologie qui présente la particularité d'une structure évolutive à la demande des utilisateurs.

Cerise sur le gâteau, Freebase propose pour gérer cette ontologie une interface très agréable, facile à manipuler et qui permet très simplement d'éditer une donnée, d'en ajouter, de relier une ressource à une autre.

Réaction immédiate : c'est génial, c'est effectivement la première application du Web sémantique ! En apparence et au premier abord, tout y est et il faut l'avouer, c'est impressionnant. Mais, à y regarder de plus près, deux problèmes se posent : l'un est technologique et l'autre est, je dirais, cognitif.

Lire la suite...

Management de l'information RDF Sparql Causeries Wikipedia Linked Data — 

Data, web of data, hyperdata : vivent les données !

Le monde du Web sémantique est en pleine ébullition en ce moment. Il ne se passe pas une semaine sans qu'une nouvelle ne fasse sensation et dépasse le cercle restreint des initiés. La dernière en date est sans conteste l'annonce de l'ouverture en bêta restreinte du service Twine qu'il me tarde de découvrir. Cette agitation est alimentée par le buzz fait autour du concept de Web 3.0 que beaucoup assimile au Web sémantique, sans, bien souvent, savoir exactement à quoi il fait référence.

Mais, au-delà du buzzword, il existe une vraie évolution et une réalité. Les technologies du Web sémantique arrivent à maturité, des applications concrètes commencent à poindre leur nez et les données décrites en RDF font peu à peu leur apparition sur le Web. Plus que le pseudo-concept de Web 3.0, la période qui s'annonce devrait être marquée par les concepts que renferment les expressions "hyperdata" et "Web of data". Ces termes montrent la voie que prend actuellement le Web sémantique, plus proche des utilisateurs et de la vision de Tim Berners-Lee que des tenants de l'intelligence artificielle. Il faut alors se souvenir des mots de Jim Hendler en forme de Mea Culpa qui avouait son erreur en intégrant les technologies de l'intelligence artificielle dans le Web sémantique.

Il ne faut évidemment pas tomber dans l'extrémisme et oublier tous les apports que peuvent avoir certaines de ces technologies, mais il est aujourd'hui certain que le Web sémantique ne se créera pas à partir des fondations de l'intelligence artificielle mais plutôt du Web.

J'espère avoir le temps de revenir plus en détail sur les concepts d'hyperdata et de Web of data et leurs conséquences dans de prochains billets. Mais, avant cela, pour vous convaincre ou vous permettre de comprendre, je vous propose trois ressources indispensables

Lire la suite...

Management de l'information Web sémantique Causeries —  11 commentaires

L'information en révolution

Mike Wesch , à l'origine de la superbe vidéo sur le Web 2.0 The Machine is Us/ing Us, a mis à disposition une nouvelle vidéo intitulé Information R/evolution

Lire la suite...

Management de l'information Causeries Folksonomie — 

Des écrans à la chaîne

Il semblerait qu'une nouvelle chaîne a fait son apparition dans la blogosphère et Christian m'a introduit dans la boucle. Avec un peu de retard, je m'exécute, histoire aussi de reprendre en douceur les rênes de ce blog, que j'ai délaissé ces derniers temps.

Le principe est de proposer à ses lecteurs une copie d'écran de son bureau. Voici donc celui de mon ordinateur personnel

Lire la suite...

Causeries Perso —  2 commentaires

Dbpedia en action la suite

Saviez-vous qu'Emma Watson, alias Hermione Granger dans les adaptations au cinéma d'Harry Potter, est née à Paris ?

Pour ma part, je l'ai découvert en mettant au point une autre série d'exemples d'utilisation de Dbpedia, en m'interressant cette fois-ci aux personnes. Le principe est simple, vous choisissez dans la liste la ville qui vous intéresse, par exemple, Paris et vous découvrirez les différentes personnes nées dans cette ville et présentes dans Dbpedia, c'est à dire dans Wikipédia. La mise en forme et la navigation dans la page de résultat est assurée par l'excellent logiciel/script du projet Simile, Exhibit. J'ai volontairement limité la liste des villes, car le principe est toujours le même. J'en ai profité pour placer un lien directe vers cette page depuis la carte des capitales européennes.

Lire la suite...

Sparql Wikipedia Geekeries Linked Data —  13 commentaires

Dbpedia en action

Il y a quelques mois, je titrais mon billet présentant Dbpedia : « Dbpedia ou la puissance du RDF au profit du savoir ». Mis à part deux exemples très simples qui, d'ailleurs, ne fonctionnent plus aujourd'hui avec la nouvelle version de Dbpedia, cette affirmation restait toute théorique.

Pierre Lindenbaum, quant à lui, avait mis au point un exemple plus probant : Wikistory, qui présentait les biographies des scientifiques célèbres présents dans Dbpedia.

A l'occasion de la nouvelle version de Dbpedia, je me suis remis au boulot et j'ai mis au point quelques exemples qui, je l'espère, montreront tout l'intérêt de disposer de données structurées, disponibles sous une forme normalisée, RDF, et interrogeable via un langage de requête et un protocole normalisé, SPARQL. Bref, montrer l'intérêt des technologies du Web sémantique.

Sur ce mini-site, je vais donc rassembler différents exemples. J'ai pour l'instant deux exemples :

Lire la suite...

Sparql Wikipedia Geekeries Linked Data —  7 commentaires

qu'est-ce-qui distingue le Web du Web sémantique ?

Les technologies du Web (HTML, XML, CSS...) ont pour but de structurer/afficher des documents et de relier ces différents documents par des liens non typés.

Les technologies du Web sémantique (RDF, SPARQL, RDFa...) ont pour but de structurer/définir les données/les messages des documents et de relier ces différentes données par des liens typés.

Tout est histoire de granularité...

Lire la suite...

Web sémantique Web Causeries —  12 commentaires

Sparql, maillon essentiel du « Web of data »

Avec l'initiative Linked data dont Dbpedia est l'exemple le plus représentatif, nous disposons d'une masse de données structurées de plus en plus importantes. Peu à peu se constituent sur le Web des entrepôts de données décentralisées, mais reliées par l'utilisation de RDF et de la propriété OWL « sameAs ».

Par exemple : la notice Paris dans Dbpedia est reliée à la notice Paris dans Geonames via le triple suivant :

<rdf:Description rdf:about="http://dbpedia.org/resource/Paris">
<owl:sameAs rdf:about="http://sws.geonames.org/2988507/"/>
</rdf:Description>

De cette façon, vous pouvez interroger de toutes les informations de Dbpedia et de Geonames sur la ressource « Paris ». Les applications sont très nombreuses, comme par exemple ma knowledge box (qui semble fonctionner cahin-caha, il faudra que je regarde cela) ou d'autres, comme le montre cet article.

Lire la suite...

RDF Sparql Geekeries Linked Data —  8 commentaires

De la polysémie de "catégorisation" en recherche d'informations

A l'occasion de la lecture de l'article d'Olivier Ertzcheid, Gabriel Gallezot et Eric Boutin sur les perspectives documentaires sur les moteurs de recherche, je suis tombé sur le mot « catégorisation », j'imagine, pour définir la fonctionnalités des « termes associés » d'Exalead. Il s'avère que ce terme est une source d'ambiguïté permanente dans le domaine de la recherche d'informations, faisant référence à plusieurs fonctionnalités et plusieurs technologies différentes. Je vous propose de faire le point afin d'y voir plus clair.

Lire la suite...

Management de l'information Causeries Moteur de recherche —  1 commentaire

RDF pour les nuls

Préambule du 27 août 2007 : à la suite d'un bon billet de David sur RDF, je voulais ajouter en commentaire la référence vers ce billet que j'avais écrit le 8 septembre 2006 ; je me suis alors aperçu qu'il n'avait pas été récupéré lors de l'import de mon ancien blog. Comme j'avais un peu la flemme de rechercher dans mes archives persos, mon sauveur se nomme Internet Archive dont le crawler salutaire avait indexé cette page. Qu'il en soit remercié. Le voici donc republié en l'état, en espérant que les commentateurs de l'époque m'excuseront le fait que je ne récupère pas leur prose ;-).

Pour vous faire apprécier pleinement toute la substantifique moelle du prochain billet, je me suis dit qu'il serait peut-être utile de réexpliquer le principe général de RDF1. Je voulais rassembler toute cela en un billet, mais ça faisait un peu long, alors j'ai séparé les choses. Donc, ceux qui ont déjà tout compris, vous pouvez attendre sagement le prochain billet (promis, il devrait arriver dans la foulée), pour ceux qui voudraient une piqûre de rappel voire plus, je vous invite à lire cet essai d'explication pédagogique de RDF (vous me direz en commentaire si ça vous paraît clair).

Lire la suite...

RDF Causeries —  2 commentaires