Google n'est pas qu'un moteur de recherche, c'est un très bon moteur de recherche. Une page modifiée sur Internet se retrouvera réindexée assez rapidement.
Notre concordancier bilingue n'est pas encore tout à fait en temps réel. Une page qui a été changée ne se retrouve pas aussi rapidement dans notre index que dans celui de Google. Il y a beaucoup d'étapes à franchir... détecter les pages modifiées ou nouvelles sur Internet, détecter la page dans l'autre langue, extraire les segments, les aligner, enrichir les segments, créer des index et, finalement, distribuer les index dans notre architecture unique. Pour un corpus donné, il peut s'agir de beaucoup de données et de traitement.
Bref, il y a plusieurs problèmes à surmonter et les solutions ne sont pas tous bonnes. Nous ne voulons surtout pas sacrifier notre vitesse de recherche.
Nous avons commencé ce projet il y a quelques semaines. Enfin, nous avons mise en place la première étape qui consiste à mettre à jour certains sites en temps réel de façon automatique, et ce, plusieurs fois par jour.
Voici les deux sites en question :
HANSARD - Les débats parlementaires
NEWSGCCA - Centre des nouvelles du Canada
Pourquoi avoir commencé par ces deux sites? Eh bien, parce que, dans le cas de ces sites, il est facile de voir par où les fichiers sont ajoutés. Les débats parlementaire et le Centre des nouvelles du Canada effectuent leurs mises à jour à des endroits biens précis.
Ce n'est pas en temps réel, mais c'est assez proche. Vous pouvez le constater en consultant la page Web qui décrit nos corpus : Les statistiques des corpus de TradooIT. En fait, les nouvelles versions de ces deux sites sont indexées dans TradooIT avant Google! (2 pour TradooIT et 100 353 883 pour Google) Bon, il faut bien commencer quelque part...
D'un autre côté, il faut près d'un mois pour balayer certains sites. Alors, vous pouvez vous imaginez qu'il ne sera pas possible d'offrir du temps réel pour tous les sites. Par contre, notre architecture nous permet de savoir quelles pages ont été modifiées et de retraiter seulement ces pages-là! Donc, vous pouvez vous attendre à ce que la mise à jour des sites se fasse plus régulièrement bientôt!
S'il y a un site (nouveau ou pas) que vous aimeriez que nous réindexions en temps réel, n'hésitez pas à communiquer avec nous!
Bonne recherche!
Monday, 27 February 2012
Monday, 13 February 2012
Le temps qui passe...
Combien de temps passez-vous à attendre vos résultats de recherche?
Vous ne le savez pas?
Supposons qu'un langagier effectue au moins 66 requêtes par jour en utilisant différents outils. Si le temps d'attente est de 1 seconde par requête, ça veut dire qu'il attendra 66 secondes par jour. Si le temps d'attente est de 5 secondes, il attendra 5 minutes et demie.
De temps en temps, il peut arriver que les résultats prennent plus de temps que d'habitude. On peut vivre avec ça. Mais, si nos 66 recherches prennent chacune 5 secondes à retourner des résultats, notre patience est mise à l'épreuve. En plus, s'il n'y a aucun résultat, ça peut devenir très frustrant. Une telle situation nous pousse à y penser deux fois avant de faire une requête.
Combien d'entre nous faisons une recherche dans Google juste pour nous rendre sur un site dont nous connaissons l'adresse URL? Nous le faisons parce que Google est rapide et qu'il nous corrigera si nous nous trompons!
Certains de nos utilisateurs font jusqu'à 600 requêtes par jour. Imaginez-vous, si les résultats mettaient 5 secondes à revenir, ces utilisateurs pourraient attendre jusqu'à 50 minutes par jour! Sérieusement, je ne pense pas que nous aurions des utilisateurs qui feraient autant de requêtes si notre système était lent. Notre concordancier retourne les résultats en moyenne en 250 à 500 millisecondes environ.
Est-ce acceptable? Notre objectif est de tout retourner en moins de 300 millisecondes. À cette vitesse, l'utilisateur interagit avec le système plutôt que d'attendre.
Maintenant, combien de temps passez-vous à chercher l'information dans les résultats retournés? En effet, même si la recherche est rapide, il faut quand même être en mesure de trouver l'information rapidement.
Le premier élément à regarder est le surlignage des chaînes dans les deux langues. J'espère qu'aujourd'hui tous les outils offrent cette fonctionnalité.
Deuxième élément : la présentation de l'information. Lorsqu'il y a 25 000 résultats, est-ce vraiment utile de voir seulement 10 segments alignés? Dans TradooIT, nous pensons qu'il est important d'avoir une vue d'ensemble de toutes les 25 000 occurrences. Une des façons de vous aider est d'afficher des statistiques sur différents aspects de votre recherche, et ce, pour la totalité des résultats. Ces rubriques (à gauche) peuvent aussi servir de filtre, tout dépendant de vos besoins et contextes.
Troisième étape, éviter que les utilisateurs aient à faire plusieurs recherches pour la même chose. Lorsqu'il y a peu ou pas de résultats, pourquoi ne pas vérifier l'orthographe (p. ex., evaluaiton) ou bien trouver une chaîne semblable (p. ex., records debts au lieu de recording debts)? Pour en savoir davantage à ce sujet, vous pouvez lire un autre blogue dédié à cette fonctionnalité. À ce titre, TradooIT offre aussi un langage d'interrogation qui permet de rechercher entre autres sur la racine des mots (p. ex., record+ debt+) et éviter de faire plusieurs recherches pour le singulier, pluriel, conjugaisons, etc. (Voir le blogue à ce sujet.)
Également, pourquoi ne pas rechercher aussi dans des sites terminologiques et ainsi faire d'une pierre deux, trois, quatre coups ou même plus?
Bref, il y a plein de petits détails qui font en sorte qu'un outil augmente ou baisse l'efficacité d'un langagier. On vous réserve d'autres petits détails du genre que vous allez voir au courant des semaines et des mois à venir...
Entre-temps, faites-nous part de vos idées pour augmenter votre efficacité!
Bonne recherche!
Vous ne le savez pas?
Supposons qu'un langagier effectue au moins 66 requêtes par jour en utilisant différents outils. Si le temps d'attente est de 1 seconde par requête, ça veut dire qu'il attendra 66 secondes par jour. Si le temps d'attente est de 5 secondes, il attendra 5 minutes et demie.
De temps en temps, il peut arriver que les résultats prennent plus de temps que d'habitude. On peut vivre avec ça. Mais, si nos 66 recherches prennent chacune 5 secondes à retourner des résultats, notre patience est mise à l'épreuve. En plus, s'il n'y a aucun résultat, ça peut devenir très frustrant. Une telle situation nous pousse à y penser deux fois avant de faire une requête.
Combien d'entre nous faisons une recherche dans Google juste pour nous rendre sur un site dont nous connaissons l'adresse URL? Nous le faisons parce que Google est rapide et qu'il nous corrigera si nous nous trompons!
Certains de nos utilisateurs font jusqu'à 600 requêtes par jour. Imaginez-vous, si les résultats mettaient 5 secondes à revenir, ces utilisateurs pourraient attendre jusqu'à 50 minutes par jour! Sérieusement, je ne pense pas que nous aurions des utilisateurs qui feraient autant de requêtes si notre système était lent. Notre concordancier retourne les résultats en moyenne en 250 à 500 millisecondes environ.
Est-ce acceptable? Notre objectif est de tout retourner en moins de 300 millisecondes. À cette vitesse, l'utilisateur interagit avec le système plutôt que d'attendre.
Maintenant, combien de temps passez-vous à chercher l'information dans les résultats retournés? En effet, même si la recherche est rapide, il faut quand même être en mesure de trouver l'information rapidement.
Le premier élément à regarder est le surlignage des chaînes dans les deux langues. J'espère qu'aujourd'hui tous les outils offrent cette fonctionnalité.
Deuxième élément : la présentation de l'information. Lorsqu'il y a 25 000 résultats, est-ce vraiment utile de voir seulement 10 segments alignés? Dans TradooIT, nous pensons qu'il est important d'avoir une vue d'ensemble de toutes les 25 000 occurrences. Une des façons de vous aider est d'afficher des statistiques sur différents aspects de votre recherche, et ce, pour la totalité des résultats. Ces rubriques (à gauche) peuvent aussi servir de filtre, tout dépendant de vos besoins et contextes.
Troisième étape, éviter que les utilisateurs aient à faire plusieurs recherches pour la même chose. Lorsqu'il y a peu ou pas de résultats, pourquoi ne pas vérifier l'orthographe (p. ex., evaluaiton) ou bien trouver une chaîne semblable (p. ex., records debts au lieu de recording debts)? Pour en savoir davantage à ce sujet, vous pouvez lire un autre blogue dédié à cette fonctionnalité. À ce titre, TradooIT offre aussi un langage d'interrogation qui permet de rechercher entre autres sur la racine des mots (p. ex., record+ debt+) et éviter de faire plusieurs recherches pour le singulier, pluriel, conjugaisons, etc. (Voir le blogue à ce sujet.)
Également, pourquoi ne pas rechercher aussi dans des sites terminologiques et ainsi faire d'une pierre deux, trois, quatre coups ou même plus?
Bref, il y a plein de petits détails qui font en sorte qu'un outil augmente ou baisse l'efficacité d'un langagier. On vous réserve d'autres petits détails du genre que vous allez voir au courant des semaines et des mois à venir...
Entre-temps, faites-nous part de vos idées pour augmenter votre efficacité!
Bonne recherche!
Thursday, 2 February 2012
Quels corpus y a-t-il dans le concordancier bilingue TradooIT ?
Cette question nous a été posée à quelques reprises. Nous comprenons qu'il est très important pour vous de savoir la source des corpus pour des questions de qualité et de fiabilité. Notre concordancier montre la source de chaque occurrence, mais, jusqu'à tout récemment, il était impossible pour nos utilisateurs d'obtenir une vue d'ensemble des différentes sources de données de TradooIT. Certains utilisateurs ont même pris le temps de nous en informer! Je leur en remercie!
C'est donc pour satisfaire votre curiosité que nous avons construit la page suivante : "Les statistiques des corpus de TradooIT".
En plus de vous donner une description de chaque source, nous avons été plus loin! En effet, pour chaque corpus, nous fournissons plein d'autre renseignements : le nombre de documents, de segments, de mots ainsi que la dernière mise à jour effectuée.
La description est très utile. Ce n'est pas parce que LOICAN est là que nous indexons tout le site des lois canadiennes. Il arrive que seulement certaines sections des sites soient indexées et c'est dans la description que vous trouverez ces précisions. Nous n'avons pas encore terminé de rédiger les descriptions des sites, mais nous nous engageons à vous fournir le plus de détails possible sous peu.
Notre concordancier bilingue vous permet également de faire des recherches dans des sites terminologiques. Par contre, ceux-ci ne sont pas mentionnés sur la page des statistiques puisqu'il ne s'agit pas de corpus....
Nous travaillons en ce moment même à automatiser la mise à jour des données. Il est donc à prévoir que, très prochainement, nos corpus seront mis à jour régulièrement, de façon automatisée! (Ce sera d'ailleurs le sujet de mon prochain blogue.)
Nous avons mis un lien en bas de la page de statistiques des corpus, qui vous permet d'envoyer des commentaires ou des suggestions sur les corpus que vous aimeriez voir ajoutés à notre concordancier bilingue. N'hésitez pas à l'utiliser!
Bonne recherche!
C'est donc pour satisfaire votre curiosité que nous avons construit la page suivante : "Les statistiques des corpus de TradooIT".
En plus de vous donner une description de chaque source, nous avons été plus loin! En effet, pour chaque corpus, nous fournissons plein d'autre renseignements : le nombre de documents, de segments, de mots ainsi que la dernière mise à jour effectuée.
La description est très utile. Ce n'est pas parce que LOICAN est là que nous indexons tout le site des lois canadiennes. Il arrive que seulement certaines sections des sites soient indexées et c'est dans la description que vous trouverez ces précisions. Nous n'avons pas encore terminé de rédiger les descriptions des sites, mais nous nous engageons à vous fournir le plus de détails possible sous peu.
Notre concordancier bilingue vous permet également de faire des recherches dans des sites terminologiques. Par contre, ceux-ci ne sont pas mentionnés sur la page des statistiques puisqu'il ne s'agit pas de corpus....
Nous travaillons en ce moment même à automatiser la mise à jour des données. Il est donc à prévoir que, très prochainement, nos corpus seront mis à jour régulièrement, de façon automatisée! (Ce sera d'ailleurs le sujet de mon prochain blogue.)
Nous avons mis un lien en bas de la page de statistiques des corpus, qui vous permet d'envoyer des commentaires ou des suggestions sur les corpus que vous aimeriez voir ajoutés à notre concordancier bilingue. N'hésitez pas à l'utiliser!
Bonne recherche!
Monday, 16 January 2012
Nouveau corpus dans le concordancier bilingue : Brevets
Jusqu'à présent, TradooIT n'avait pas beaucoup de corpus techniques. Certes, le site terminologique TERMIUM vers lequel TradooIT renvoie contient beaucoup de termes techniques, mais il manquait des corpus techniques illustrant l'usage. Ce qui veut dire que les recherches sur "ONCOLYTIC VIRUS" ou "GAMETOCIBES" ne donnaient aucun résulat.
Eh bien, nous sommes heureux de vous annoncer que nous avons ajouté les brevets depuis 1869 à partir des données de l'Office de la propriété intellectuelle du Canada. La majorité des titres et beaucoup d'abrégés des brevets ont ainsi été insérés dans notre corpus. Tout cela totalise 29 991 239 mots assez techniques, ce qui donne un corpus global de 230 millions de mots dans chaque langue. Hourra! Nous avons franchi la barre des 200 millions!
Le simple balayage du site nous a pris 30 jours... Pour récupérer plus de 511 439 brevets. Il y en a beaucoup plus que cela; malheureusement, certaines pages n'ont pas pu être téléchargées pour diverses raisons techniques. Lors de notre prochain balayage, nous remédierons à ce problème. Je ne voulais pas vous faire attendre encore 30 jours avant de vous donner un aperçu des données!
Pour chacune des 500 000 pages, il y a seulement une partie des documents qui est traduite, soit les titres et les abrégés, et encore là, pas toujours.
La traduction des titres est disponible la plupart du temps. Plus on remonte dans le temps, moins ils sont traduits. En effet, un brevet de 1906 a moins de chance d'être traduit qu'un brevet de 2011.
Il est important de noter que les titres sont entièrement en majuscules et que les accents n'y figurent pas (ex.: METHODE DE LIBERATION CONTROLEE). Je ne connais pas exactement la raison de cela, mais, si quelqu'un peut m'éclairer là-dessus, je pourrais faire part de cette information à tout le monde.
Les abrégés ont les accents, mais ils sont moins souvent traduits. On ne peut pas tout avoir!
Pour ce qui est du reste du document, il se trouve dans la langue de la personne qui a soumis le brevet. La majorité du temps, c'est l'anglais.
Le niveau de langue des mots est assez unique. Pour obtenir un alignement de mots de haute qualité, nous avons donc créé un modèle d'alignement de mots spécialement pour ce corpus.
Même si ce corpus est disponible dès maintenant, nous comptons continuer de l'améliorer. Première étape, analyser le travail requis pour remettre les accents dans les titres. Il est plus agréable de voir "APPAREIL ET PROCÉDÉ VIDÉO D'ENTRAÎNEMENT" que "APPAREIL ET PROCEDE VIDEO D'ENTRAINEMENT", n'est-ce pas? Si vous avez des idées à ce sujet, n'hésitez pas à nous les communiquer.
Bonne recherche!
Wednesday, 11 January 2012
Langage d'interrogation d'un concordancier bilingue
Il est très difficile de définir un langage d'interrogation qui sera à la fois simple et utile.
Il existe une profonde différence entre un concordancier bilingue et un moteur de recherche sur Internet. Le premier s'adresse principalement aux langagiers, tandis que le second s'adresse à monsieur et madame Tout-le-monde. C'est pourquoi, nous avons cru nécessaire de doter notre concordancier d'un langage d'interrogation adapté aux langagiers.
Saviez-vous que TradooIT n'utilise que trois symboles pour les recherches? C'est l'été dernier qu'on a sélectionné ces symboles et établi leur signification. Il y a eu de nombreux débats lors de la sélection. Notre choix final s'est beaucoup inspiré des grands moteurs de recherche avec une touche particulière des langagiers!
Nous avons donc établi que :
Notre concordancier bilingue, conjugué avec son langage d'interrogation, permet d'être utilisé comme dictionnaire bilingue, de trouver des cooccurrences, de réviser des traductions, de traduire des mots dans un sens bien précis, etc.
Voici quelques exemples d'emploi du langage d'interrogation :
Bonne recherche!
Simon
Il existe une profonde différence entre un concordancier bilingue et un moteur de recherche sur Internet. Le premier s'adresse principalement aux langagiers, tandis que le second s'adresse à monsieur et madame Tout-le-monde. C'est pourquoi, nous avons cru nécessaire de doter notre concordancier d'un langage d'interrogation adapté aux langagiers.
Saviez-vous que TradooIT n'utilise que trois symboles pour les recherches? C'est l'été dernier qu'on a sélectionné ces symboles et établi leur signification. Il y a eu de nombreux débats lors de la sélection. Notre choix final s'est beaucoup inspiré des grands moteurs de recherche avec une touche particulière des langagiers!
Nous avons donc établi que :
- "+" est ajouté à la fin d'un mot pour faire une recherche sur son radical et trouver toutes ses formes (singulier/pluriel, conjugué, nom, verbe, adjectif, etc.).
- "*" peut être ajouté n'importe où dans l'expression de recherche pour indiquer la présence obligatoire d'un mot. On peut aussi en ajouter plusieurs pour remplacer plusieurs mots.
- "?" peut être ajouté n'importe où dans l'expression de recherche pour indiquer la présence facultative d'un mot. On peut aussi en ajouter plusieurs.
Notre concordancier bilingue, conjugué avec son langage d'interrogation, permet d'être utilisé comme dictionnaire bilingue, de trouver des cooccurrences, de réviser des traductions, de traduire des mots dans un sens bien précis, etc.
Voici quelques exemples d'emploi du langage d'interrogation :
- effective ? skills : Pour savoir comment traduire "effective" lorsqu'il qualifie "skills". Dans ce contexte, il n'est pas important qu'il s'agisse de "communication skills", de "writing skills", etc.
- deal with ? conflicts+ : Pour trouver des cooccurrents de "conflict(s)" au sens de "deal with".
- provide+ ? service+ : Lors de la révision d'un texte, un réviseur se demande si "provide a service" peut vraiment être traduit par "donner un service". En recherchant les traductions de "provide+ ? service+", vous confirmez en un clin d'oeil que la traduction "donner un service" ne figure pas dans la liste!
Attention, cependant. Vous savez probablement qu'il ne faut pas se fier aveuglément aux résultats de recherche dans les concordanciers bilingues. Leur fiabilité dépend énormément de la qualité des traductions et de l'exhaustivité du corpus.
Bonne recherche!
Simon
Wednesday, 7 December 2011
Nouvelle source terminologique dans TradooIT : ONTERM
Vous savez probablement déjà que toutes les recherches que vous faites dans TradooIT peuvent vous retourner des résultats provenant de Termium.
Nous avons maintenant ajouté ONTERM comme source de terminologie. ONTERM contient environ 23 000 entrées, principalement des appellations officielles du gouvernement ontarien et des appellations génériques.(ex: aboriginal affairs)
S'il y a une source terminologique que vous aimeriez voir ajouter dans notre concordancier bilingue, n'hésitez surtout pas à communiquer avec nous!
Bonne recherche!
Nous avons maintenant ajouté ONTERM comme source de terminologie. ONTERM contient environ 23 000 entrées, principalement des appellations officielles du gouvernement ontarien et des appellations génériques.(ex: aboriginal affairs)
S'il y a une source terminologique que vous aimeriez voir ajouter dans notre concordancier bilingue, n'hésitez surtout pas à communiquer avec nous!
Bonne recherche!
Wednesday, 23 November 2011
Baptême de TradooIT
Au cours des deux dernières semaines, nous avons pris part à deux conférences, celle de l'AILIA et celle de l'OTTIAQ. Nous pouvons dire que ce fut le baptême de notre concordancier bilingue, car c'était la première fois que nous le montrions au grand public.
Nous étions impatients (et même anxieux) de vous rencontrer et de recevoir vos commentaires. Bien sûr, nous aurions pu repousser la présentation et améliorer le produit... faire d'autres tests... allonger la période d'essai interne... Mais nous avons déjà fait tout cela. Ce serait mentir que de dire que le produit n'était pas prêt.
Lors de la présentation de notre produit, vos commentaires ont tous été très positifs, ce qui vient confirmer ce que nous pensions : TradooIT comble des besoins grâce à ses fonctionnalités uniques.
Vous avez même eu de bonnes idées pour améliorer le produit. Nous ne pouvions pas en demander plus!
Cela dit, nous continuerons de travailler fort pour améliorer le produit, et j'espère que vous suivrez notre évolution!
Merci à tous les participants!
Bonne recherche!
Nous étions impatients (et même anxieux) de vous rencontrer et de recevoir vos commentaires. Bien sûr, nous aurions pu repousser la présentation et améliorer le produit... faire d'autres tests... allonger la période d'essai interne... Mais nous avons déjà fait tout cela. Ce serait mentir que de dire que le produit n'était pas prêt.
Lors de la présentation de notre produit, vos commentaires ont tous été très positifs, ce qui vient confirmer ce que nous pensions : TradooIT comble des besoins grâce à ses fonctionnalités uniques.
Vous avez même eu de bonnes idées pour améliorer le produit. Nous ne pouvions pas en demander plus!
Cela dit, nous continuerons de travailler fort pour améliorer le produit, et j'espère que vous suivrez notre évolution!
Merci à tous les participants!
Bonne recherche!
Subscribe to:
Posts (Atom)