Monday, 4 June 2012

Sécurité et confidentialité de vos données!


Que vous soyez un traducteur autonome ou un cabinet de traduction, vos traductions, votre terminologie, bref, toutes vos données sont très précieuses pour vous. C'est pourquoi, lorsque nous avons introduit la mémoire privée, nous avons pris la sécurité très au sérieux.

Authentification
En tant qu'utilisateur, vous pouvez vous connecter à TradooIT par le biais de votre compte Google, Facebook ou Yahoo. De cette façon, seule votre adresse électronique est transférée à TradooIT; votre mot de passe demeure secret. Dans le cas où vous créeriez un compte directement avec TradooIT, votre mot de passe serait encrypté pour assurer la confidentialité absolue de l'échange de données.

Confidentialité
Lorsque vous insérez des données dans TradooIT, vous seul y avez accès! En effet, une place privilégiée est créée sur nos serveurs lorsque vous utilisez la mémoire de TradooIT. Cet emplacement n'est accessible qu'à vous. Dites-vous que, depuis plus de deux ans, nous archivons des millions de segments, et ce, de façon très sécuritaire pour des clients qui, comme vous, nous ont fait confiance.

Encryption de la connexion
Qu'est-ce que TradooIT et une banque ont en commun? Mis à part que nous gardons vos biens les plus précieux, la réponse est que nous affichons le même petit symbole vert au début de l'adresse, qui indique que le site est très sécurisé.


Pour vous, cela signifie que les données que vous transférez par notre connexion ne peuvent pas être lues par une tierce personne! Ce symbole apparaîtra seulement dans les endroits sensibles du site.

Perte de données
Vous est-il déjà arrivé de perdre des données? Ce sont des choses qui arrivent : virus, perte de disque dur, suppression de vos fichiers par accident, etc. De notre côté, nous utilisons un modèle très unique qui réplique une partie de vos données dès le moment où vous les téléchargez dans TradooIT.
Nous effectuons également des sauvegardes quotidiennes de toutes vos données.

Je n'essaie pas de vous convaincre que nous sommes parfaits, mais nous travaillons sans relâche à améliorer notre écosystème pour vous permettre d'en profiter au maximum!

Bonne recherche!


Monday, 30 April 2012

Memoires Privées

TradooIT vous offre maintenant une composante de mémoire privée, qui vous permet d'importer vos propres archives et d'y faire des recherches à l'aide du concordancier bilingue.

Saviez-vous que, depuis plusieurs années déjà, des entreprises privées confient leurs immenses mémoires à TradooIT? Elles bénéficient ainsi de plusieurs avantages...

Faites de même, et votre expérience du concordancier bilingue de TradooIT changera du tout au tout.

En effet, en une seule recherche, vous pourrez fouiller dans plusieurs sites Internet et terminologiques, ainsi que dans vos propres bitextes. Vous obtiendrez le même genre de résultats pour vos bitextes que pour les bitextes publics : statistiques de traduction, 1001 formes, sources, etc. De plus, vous pourrez obtenir le compte de mots de votre mémoire et attribuer des étiquettes pour filtrer encore plus efficacement.

Les techniques de filtrage (persistantes ou temporaires) vous permettront de consulter seulement les bitextes que vous désirez.

N'est-ce pas merveilleux? D'autres composantes de l'écosystème TradooIT utilisant vos bitextes s'ajouteront très bientôt.

Innovation
TradooIT se fait un devoir d'innover pour chaque composante de son écosystème. Pour ceux qui connaissent notre concordancier bilingue, son approche innovatrice ne fait aucun doute!

Architecture
Lorsque vous importez vos bitextes, ils sont insérés dans l'architecture unique de TradooIT. Nos multiples serveurs assureront la disponibilité de vos bitextes en tout temps! Les technologies et méthodologies que nous développons sont normalement offertes à des entreprises, mais notre but est de les rendre accessibles pour vous!

Bitextes
Toutes vos mémoires seront stockées sous forme de bitextes dans TradooIT. La raison est fort simple : on souhaite garder le contexte. Un texte n'est pas seulement une suite de segments décontextualisés... Êtes-vous d'accord avec ça? Le contexte renferme un grande richesse de renseignements...
La prochaine composante que nous dévoilerons (très bientôt) utilisera à pleine capacité ce que plusieurs produits oublient trop souvent.

Si votre mémoire est une suite de segments, TradooIT fera de son mieux pour regrouper les segments en bitextes. Par contre, il serait avantageux pour vous d'importer vos mémoires sous forme de texte (p. ex., un fichier TMX par bitexte) pour garder le contexte.

Sécurité
Dormez tranquille, les bitextes que vous importez dans TradooIT peuvent être consultés par vous seulement. Il ne sont pas partagés avec les autres utilisateurs. En effet, lorsque vous prenez quelques secondes pour créer un compte, TradooIT crée un espace sécurisé pour vous. Nous accordons une très grande importance à la sécurité!

Rétroaction
Comme toujours, vos commentaires sont crucials pour nous. TradooIT a été conçu par vous et pour vous! Envoyez-vous un courriel ou un commentaire par le biais de la communauté TradooIT!

Cherchez autrement dans vos archives grâce à l'écosystème TradooIT : simple, rapide et efficace. Essayez-le, c'est gratuit! (pour un temps limité)

Bonne recherche!

Monday, 27 February 2012

Concordancier bilingue "sur les stéroÏdes"

Google n'est pas qu'un moteur de recherche, c'est un très bon moteur de recherche. Une page modifiée sur Internet se retrouvera réindexée assez rapidement.

Notre concordancier bilingue n'est pas encore tout à fait en temps réel. Une page qui a été changée ne se retrouve pas aussi rapidement dans notre index que dans celui de Google. Il y a beaucoup d'étapes à franchir... détecter les pages modifiées ou nouvelles sur Internet, détecter la page dans l'autre langue, extraire les segments, les aligner, enrichir les segments, créer des index et, finalement, distribuer les index dans notre architecture unique. Pour un corpus donné, il peut s'agir de beaucoup de données et de traitement.

Bref, il y a plusieurs problèmes à surmonter et les solutions ne sont pas tous bonnes. Nous ne voulons surtout pas sacrifier notre vitesse de recherche.

Nous avons commencé ce projet il y a quelques semaines. Enfin, nous avons mise en place la première étape qui consiste à mettre à jour certains sites en temps réel de façon automatique, et ce, plusieurs fois par jour.

Voici les deux sites en question :
HANSARD - Les débats parlementaires
NEWSGCCA - Centre des nouvelles du Canada

Pourquoi avoir commencé par ces deux sites? Eh bien, parce que, dans le cas de ces sites, il est facile de voir par où les fichiers sont ajoutés. Les débats parlementaire et le Centre des nouvelles du Canada effectuent leurs mises à jour à des endroits biens précis.

Ce n'est pas en temps réel, mais c'est assez proche. Vous pouvez le constater en consultant la page Web qui décrit nos corpus : Les statistiques des corpus de TradooIT. En fait, les nouvelles versions de ces deux sites sont indexées dans TradooIT avant Google! (2 pour TradooIT et 100 353 883 pour Google) Bon, il faut bien commencer quelque part...

D'un autre côté, il faut près d'un mois pour balayer certains sites. Alors, vous pouvez vous imaginez qu'il ne sera pas possible d'offrir du temps réel pour tous les sites. Par contre, notre architecture nous permet de savoir quelles pages ont été modifiées et de retraiter seulement ces pages-là! Donc, vous pouvez vous attendre à ce que la mise à jour des sites se fasse plus régulièrement bientôt!

S'il y a un site (nouveau ou pas) que vous aimeriez que nous réindexions en temps réel, n'hésitez pas à communiquer avec nous!

Bonne recherche!

Monday, 13 February 2012

Le temps qui passe...

Combien de temps passez-vous à attendre vos résultats de recherche?

Vous ne le savez pas?
Supposons qu'un langagier effectue au moins 66 requêtes par jour en utilisant différents outils. Si le temps d'attente est de 1 seconde par requête, ça veut dire qu'il attendra 66 secondes par jour. Si le temps d'attente est de 5 secondes, il attendra 5 minutes et demie.

De temps en temps, il peut arriver que les résultats prennent plus de temps que d'habitude. On peut vivre avec ça. Mais, si nos 66 recherches prennent chacune 5 secondes à retourner des résultats, notre patience est mise à l'épreuve. En plus, s'il n'y a aucun résultat, ça peut devenir très frustrant. Une telle situation nous pousse à y penser deux fois avant de faire une requête.

Combien d'entre nous faisons une recherche dans Google juste pour nous rendre sur un site dont nous connaissons l'adresse URL? Nous le faisons parce que Google est rapide et qu'il nous corrigera si nous nous trompons!

Certains de nos utilisateurs font jusqu'à 600 requêtes par jour. Imaginez-vous, si les résultats mettaient 5 secondes à revenir, ces utilisateurs pourraient attendre jusqu'à 50 minutes par jour! Sérieusement, je ne pense pas que nous aurions des utilisateurs qui feraient autant de requêtes si notre système était lent. Notre concordancier retourne les résultats en moyenne en 250 à 500 millisecondes environ.


Est-ce acceptable? Notre objectif est de tout retourner en moins de 300 millisecondes. À cette vitesse, l'utilisateur interagit avec le système plutôt que d'attendre.

Maintenant, combien de temps passez-vous à chercher l'information dans les résultats retournés? En effet, même si la recherche est rapide, il faut quand même être en mesure de trouver l'information rapidement.

Le premier élément à regarder est le surlignage des chaînes dans les deux langues. J'espère qu'aujourd'hui tous les outils offrent cette fonctionnalité.

Deuxième élément : la présentation de l'information. Lorsqu'il y a 25 000 résultats, est-ce vraiment utile de voir seulement 10 segments alignés? Dans TradooIT, nous pensons qu'il est important d'avoir une vue d'ensemble de toutes les 25 000 occurrences. Une des façons de vous aider est d'afficher des statistiques sur différents aspects de votre recherche, et ce, pour la totalité des résultats. Ces rubriques (à gauche) peuvent aussi servir de filtre, tout dépendant de vos besoins et contextes.

Troisième étape, éviter que les utilisateurs aient à faire plusieurs recherches pour la même chose. Lorsqu'il y a peu ou pas de résultats, pourquoi ne pas vérifier l'orthographe (p. ex., evaluaiton) ou bien trouver une chaîne semblable (p. ex., records debts au lieu de recording debts)? Pour en savoir davantage à ce sujet, vous pouvez lire un autre blogue dédié à cette fonctionnalité. À ce titre, TradooIT offre aussi un langage d'interrogation qui permet de rechercher entre autres sur la racine des mots (p. ex., record+ debt+) et éviter de faire plusieurs recherches pour le singulier, pluriel, conjugaisons, etc. (Voir le blogue à ce sujet.)

Également, pourquoi ne pas rechercher aussi dans des sites terminologiques et ainsi faire d'une pierre deux, trois, quatre coups ou même plus?

Bref, il y a plein de petits détails qui font en sorte qu'un outil augmente ou baisse l'efficacité d'un langagier. On vous réserve d'autres petits détails du genre que vous allez voir au courant des semaines et des mois à venir...

Entre-temps, faites-nous part de vos idées pour augmenter votre efficacité!

Bonne recherche!

Thursday, 2 February 2012

Quels corpus y a-t-il dans le concordancier bilingue TradooIT ?

Cette question nous a été posée à quelques reprises. Nous comprenons qu'il est très important pour vous de savoir la source des corpus pour des questions de qualité et de fiabilité. Notre concordancier montre la source de chaque occurrence, mais, jusqu'à tout récemment, il était impossible pour nos utilisateurs d'obtenir une vue d'ensemble des différentes sources de données de TradooIT. Certains utilisateurs ont même pris le temps de nous en informer! Je leur en remercie!

C'est donc pour satisfaire votre curiosité que nous avons construit la page suivante : "Les statistiques des corpus de TradooIT".

En plus de vous donner une description de chaque source, nous avons été plus loin! En effet, pour chaque corpus, nous fournissons plein d'autre renseignements : le nombre de documents, de segments, de mots ainsi que la dernière mise à jour effectuée.

La description est très utile. Ce n'est pas parce que LOICAN est là que nous indexons tout le site des lois canadiennes. Il arrive que seulement certaines sections des sites soient indexées et c'est dans la description que vous trouverez ces précisions. Nous n'avons pas encore terminé de rédiger les descriptions des sites, mais nous nous engageons à vous fournir le plus de détails possible sous peu.

Notre concordancier bilingue vous permet également de faire des recherches dans des sites terminologiques. Par contre, ceux-ci ne sont pas mentionnés sur la page des statistiques puisqu'il ne s'agit pas de corpus....

Nous travaillons en ce moment même à automatiser la mise à jour des données. Il est donc à prévoir que, très prochainement, nos corpus seront mis à jour régulièrement, de façon automatisée! (Ce sera d'ailleurs le sujet de mon prochain blogue.)

Nous avons mis un lien en bas de la page de statistiques des corpus, qui vous permet d'envoyer des commentaires ou des suggestions sur les corpus que vous aimeriez voir ajoutés à notre concordancier bilingue. N'hésitez pas à l'utiliser!

Bonne recherche!

Monday, 16 January 2012

Nouveau corpus dans le concordancier bilingue : Brevets

Jusqu'à présent, TradooIT n'avait pas beaucoup de corpus techniques. Certes, le site terminologique TERMIUM vers lequel TradooIT renvoie contient beaucoup de termes techniques, mais il manquait des corpus techniques illustrant l'usage. Ce qui veut dire que les recherches sur "ONCOLYTIC VIRUS" ou "GAMETOCIBESne donnaient aucun résulat.

Eh bien, nous sommes heureux de vous annoncer que nous avons ajouté les brevets depuis 1869 à partir des données de l'Office de la propriété intellectuelle du Canada. La majorité des titres et beaucoup d'abrégés des brevets ont ainsi été insérés dans notre corpus. Tout cela totalise 29 991 239 mots assez techniques, ce qui donne un corpus global de 230 millions de mots dans chaque langue. Hourra! Nous avons franchi la barre des 200 millions!

Le simple balayage du site nous a pris 30 jours... Pour récupérer plus de 511 439 brevets. Il y en a beaucoup plus que cela; malheureusement, certaines pages n'ont pas pu être téléchargées pour diverses raisons techniques. Lors de notre prochain balayage, nous remédierons à ce problème. Je ne voulais pas vous faire attendre encore 30 jours avant de vous donner un aperçu des données!

Pour chacune des 500 000 pages, il y a seulement une partie des documents qui est traduite, soit les titres et les abrégés, et encore là, pas toujours.

La traduction des titres est disponible la plupart du temps. Plus on remonte dans le temps, moins ils sont traduits. En effet, un brevet de 1906 a moins de chance d'être traduit qu'un brevet de 2011.
Il est important de noter que les titres sont entièrement en majuscules et que les accents n'y figurent pas (ex.: METHODE DE LIBERATION CONTROLEE). Je ne connais pas exactement la raison de cela, mais, si quelqu'un peut m'éclairer là-dessus, je pourrais faire part de cette information à tout le monde.

Les abrégés ont les accents, mais ils sont moins souvent traduits. On ne peut pas tout avoir!

Pour ce qui est du reste du document, il se trouve dans la langue de la personne qui a soumis le brevet. La majorité du temps, c'est l'anglais.

Le niveau de langue des mots est assez unique. Pour obtenir un alignement de mots de haute qualité, nous avons donc créé un modèle d'alignement de mots spécialement pour ce corpus.

Même si ce corpus est disponible dès maintenant, nous comptons continuer de l'améliorer. Première étape, analyser le travail requis pour remettre les accents dans les titres. Il est plus agréable de voir "APPAREIL ET PROCÉDÉ VIDÉO D'ENTRAÎNEMENT" que  "APPAREIL ET PROCEDE VIDEO D'ENTRAINEMENT", n'est-ce pas? Si vous avez des idées à ce sujet, n'hésitez pas à nous les communiquer.

Bonne recherche!

Wednesday, 11 January 2012

Langage d'interrogation d'un concordancier bilingue

Il est très difficile de définir un langage d'interrogation qui sera à la fois simple et utile.

Il existe une profonde différence entre un concordancier bilingue et un moteur de recherche sur Internet. Le premier s'adresse principalement aux langagiers, tandis que le second s'adresse à monsieur et madame Tout-le-monde. C'est pourquoi, nous avons cru nécessaire de doter notre concordancier d'un langage d'interrogation adapté aux langagiers.

Saviez-vous que TradooIT n'utilise que trois symboles pour les recherches? C'est l'été dernier qu'on a sélectionné ces symboles et établi leur signification. Il y a eu de nombreux débats lors de la sélection. Notre choix final s'est beaucoup inspiré des grands moteurs de recherche avec une touche particulière des langagiers!

Nous avons donc établi que :

  • "+" est ajouté à la fin d'un mot pour faire une recherche sur son radical et trouver toutes ses formes (singulier/pluriel, conjugué, nom, verbe, adjectif, etc.).
  • "*" peut être ajouté n'importe où dans l'expression de recherche pour indiquer la présence obligatoire d'un mot. On peut aussi en ajouter plusieurs pour remplacer plusieurs mots.
  • "?" peut être ajouté n'importe où dans l'expression de recherche pour indiquer la présence facultative d'un mot. On peut aussi en ajouter plusieurs. 

Notre concordancier bilingue, conjugué avec son langage d'interrogation, permet d'être utilisé comme dictionnaire bilingue, de trouver des cooccurrences, de réviser des traductions, de traduire des mots dans un sens bien précis, etc.

Voici quelques exemples d'emploi du langage d'interrogation :

  • effective ? skills : Pour savoir comment traduire "effective" lorsqu'il qualifie "skills". Dans ce contexte, il n'est pas important qu'il s'agisse de "communication skills", de "writing skills", etc.
  • provide+ ? service+ : Lors de la révision d'un texte, un réviseur se demande si "provide a service" peut vraiment être traduit par "donner un service".  En recherchant les traductions de "provide+ ? service+", vous confirmez en un clin d'oeil que la traduction "donner un service" ne figure pas dans la liste!
    Attention, cependant. Vous savez probablement qu'il ne faut pas se fier aveuglément aux résultats de recherche dans les concordanciers bilingues. Leur fiabilité dépend énormément de la qualité des traductions et de l'exhaustivité du corpus.
Bref, toute cette flexibilité et cette puissance de recherche est possible grâce à notre architecture. N'hésitez pas à nous faire part de vos idées sur des fonctionnalités que vous aimeriez retrouver dans notre outil!

Bonne recherche!

Simon