« Bien » numériser un document avec XSane et gocr

Même si tesseract est surement le meilleur des moteurs d’ocr libre, gocr se défend aussi, bien qu’étant moins puissant par moment. tesseract est aussi puissant qu’ennuyeux à mettre en oeuvre 🙁

J’utilise gocr 0.45 en liaison avec XSane pour récupérer les données.

Pour cet essai, j’ai pris mon exemplaire de « 1984 » en anglais. Pour installer Xsane et gocr, sous mon archlinux, il m’a suffit d’entrer un petit :

yaourt -S xsane gocr

Quand aux réglages utilisés, le plus simple est encore la capture d’écran ci-dessous :

reglage xsane pour l'OCR

Après avoir sélectionné la zone à numériser, j’ai lancé la récupération, puis le visionneur m’a donné l’image png à analyser.

Essai de xsane pour de l'ocr

Il m’a suffit de cliquer sur le bouton concernant l’OCR, et voici le résultat :

IT wAs a bright cold day Ap, and the clocks were
striking thirteen. Winston Smth, his chin nuzzle to his
breast an efort to escape the vile wind, slipped qckly
through the glass doors of Victo Msions, tho4gh not
qckly enough to prevent a swirl of gtty d4st from
Lnteng along with hîm.
The hlway smelt of boiled cabbage d old rag mats.
At one end of it a colo4red poster, too large for indoor
Iî’play, had been tacked to the wa. It depicted simply an
’11cro4s face, more th a metre wide: the face ofa man
n bo4t forty-five, with a heavy black mo4stache and
1’1d1y hdsome features. Winston made for the stairs.
l t w no 4se trying the lift. Even at the best ofmes it was
rIc{cn worke, and at present the electc c4rrent was c4t
l l’l Lre daylight ho4rs. It was part ofthe economy drive
1 rt;ration for Hate Week. The Aat was seven ghts-
11l ;1l Wston, who was thjrty-nine and had a varicose
ll’c’ lvc his right kle, went slowly, resig several
l c’ 1 m way. On each lding, opposite the lift shaft,
l33 ‘l’r with the enormo4s face gazed fiom the wall. It
I ‘ c l’s’ pires which are so contved at the eyes
Ilw yl ;34t when you move. BIG BhOTHE
l W n ‘ l'(; l l I NG YOU, the caption beneath it r.
ll’ LI t a fity voice was reang o4t a list of
glr3 wlic’I I,d sumetg to do with the production of
g a; l1. ‘ I 1 L vicc came from oblong metal plaq4e like
u t3lll’l li- -rr which formed part of the surface of the
_ ght-tu1l w;ll. Winston tumed a switch d the voice
tl3wll tlceh e words were s di gsh-

Le résultat est loin d’être parfait, mais au moins, il reste lisible 😉

Pour l’image PNG, cliquez ici. Pour le texte obtenu, cliquez ici. Il reste encore du chemin à faire, mais tant que l’on est pas obligé de tout retaper à la main, c’est le principal 😉

Adieu Ubuntu, mon vrai premier amour linuxien…

Depuis hier soir, je suis un utilisateur comblé et heureux d’ArchLinux 64 bits. Même s’il m’a fallu près de 4 heures entre le début de l’installation et le lancement d’un firefox 3.0 pré-béta3 compilé maison.

Hier, vers 17 h 50, j’ai inséré le CD « core » (150 Mo environ) contenant l’image de démarrage et d’installation de la Arch Linux.

18 h 05 : l’installation – assez simple – se termine. 12 minutes, et la mise à jour préliminaire est terminée. Mais il reste encore pas mal de chose à installer : Xorg, le pilote propriétaire Nvidia, Gnome, OpenOffice.org, Gimp pour ne citer que les premiers qui me viennent à l’esprit.

18 h 50 : j’ai pu installé Xorg, le pilote Nvidia et Gnome, sans oublier les outils pour gérer mon imprimante HP Photosmart C3180.

Pour cela, il faut installer Hplip. Et pour le scanner ?

Deux étapes. Après avoir entrer :

# pacman -S hplip pyqt

  1. Entrer echo « hpaio » >> /etc/sane.d/dll.conf
  2. Ajouter le groupe lp à l’utilisateur : # gpassword -a nom utilisateur lp

Pour l’installation de Gnome : http://wiki.archlinux.org/index.php/GNOME

19 h 45 : après avoir installé les derniers outils manquant, j’ai galéré environ 45 minutes pour me configurer Compiz-Fusion…

En effet, il faut entrer les lignes :

Option "AddARGBVisuals" "True"
Option "TripleBuffer" "true"
Option "AddARGBGLXVisuals" "True"

Dans la section « device » du fichier /etc/X11/xorg.conf

Et surtout, ne pas oublier de rajouter :

Section "Extensions"
Option "Composite" "Enable"
EndSection

à la fin du même fichier. En quittant la session de travail, on tue Xorg avec la combinaison ctrl + alt + retour arrière.

Cependant, il manquait les outils de gestion de l’heure, des droits utilisateurs – entre autre – de Gnome. Bien qu’un paquet tout prêt fut disponible sur le dépot « community », ce n’était que pour la version i686 de la Arch Linux et non pour ma version 64 bits 🙁

J’ai alors été récupérer les fichiers nécessaires, à savoir System-tools-backends et Gnome-system-tools

J’ai lancé ensuite la compilation / installation en root des deux avec la commande makepkg -i.

Un redemarrage plus tard, les outils étaient fonctionnels.

Coté taille ? A vrai dire, comme la arch est assez « mécano », on installe ce qu’on veut. A partir des 125 Mo de l’installation de base, sur les 7500 Mo de la partition root, il me reste :

[fred@fredo-arch ~]$ df -h
Sys. de fich. Tail. Occ. Disp. %Occ. Monté sur
/dev/sda3 7,3G 2,9G 4,0G 42% /
none 754M 0 754M 0% /dev/shm
/dev/sda1 251M 12M 227M 5% /boot
/dev/sda4 136G 13G 117G 10% /home

Il ne faut pas oublier que j’ai installé sur la base en question :

Ce qui est quand même pas si mal que cela. Coté vélocité ? Du bip à l’écran de connexion : 30 secondes environ. De l’écran de connexion au bureau gnome utilisable : 25 secondes, car il faut lancer Compiz-Fusion…

Et dire qu’il faut compter pas loin de 45 secondes pour la première étape sous Ubuntu 7.10… Et près de 70 secondes avec une Fedora 8… Maintenant, je ne cracherais pas sur la Ubuntu qui m’a permis – et aussi à de nombreuses autres personnes – d’avoir un linux à visage humain… Et fonctionnant directement.

Arch Linux me permet de combler deux besoins : une distribution stable et assez à jour coté versions de logiciels… Sans avoir à passer 8 jours à tout recompiler.

Ajout à 14 h 30 : l’indispensable capture d’écran 😉

Gnome avec Archlinux

Les deux points qui ont bloqué ma migration vers la Arch Linux

Deux points génants, mais franchement bloquants.

  • L’impossibilité de faire reconnaitre et fonctionner le scanner de mon Imprimante HP Photosmart C3180, alors que j’ai bien ajouté le groupe scanner à mon utilisateur
  • ‘impossibilité de faire reconnaitre et fonctionner mon baladeur numérique Samsung YP-U3 🙁

Si quelqu’un peut m’aider à trouver les solutions pour ses deux points précis, qu’il / elle me le dise…

Vers la migration ? Suite.

Bon, l’installation est faite, et j’ai réussi à faire fonctionner le son, mais impossible de débloquer la « sourdine » de Gnome au démarrage.

Parmis les premiers points positifs :

  • Légèreté de l’ensemble
  • La quasi-totalité de l’environnement de compilation d’un logiciel comme mozilla est disponible presque « out-of-the-box »
  • Le noyau 2.6.23.9 après avoir effectué la mise à jour
  • Flash installé sans trop de prise de tête avec nsPluginWrapper

Points négatifs :

  • Pas d’outils de gestions des groupes de l’utilisateur 🙁
  • L’outil de gestion d’imprimante semble absent (?)
  • La « nouvelle hiérarchie » des dossiers (Documents, Musique, etc…) semble être absente de la version Gnome d’Arch Linux.
  • La corbeille directement sur le bureau !
  • Pas d’interface graphique pour l’outil « Pacman »

Je suis en train de faire recompiler un firefox 3.0 pré-béta3 dans la machine virtuelle sous Arch Linux. Si la compilation passe, un grand pas sera fait vers une potentielle migration…

Vers l’installation d’une Arch Linux ?

Bien qu’aimant la distribution Ubuntu Linux, je suis en train d’envisager une potentielle migration vers la distribution Arch Linux.

Il est vrai que l’installation est assez rapide, et que la base technique (en comptant les fichiers de développement) ne prennent que 150 Mo environ, bien qu’on se retrouve avec un système assez basique en ligne de commande.

L’approche « mécano » de la distribution Arch Linux m’intéresse aussi beaucoup.

Je vais voir avec une machine virtuelle VMWare Server pour savoir si les logiciels que j’utilise quotidiennement sont disponible et / ou compilable facilement.

Des conseils pour une potentielle migration ? Merci !