5 Commits

Author SHA1 Message Date
Aurelien
8092ca05e6 chore : ajout de test pur le parser de pdf #5 2026-06-28 17:54:45 +02:00
Aurelien
170cb74650 chore : modification de la fonction pour pouvoir parse les facture metro #5 2026-06-26 10:24:24 +02:00
Aurelien
bdff1f9028 chore : correction de la fonction #5 2026-06-24 00:09:16 +02:00
Aurelien
e597b4d161 chore : correction de la fonction #5 2026-06-24 00:04:08 +02:00
Aurelien
ef2d1ca3b2 chore : changement de biblioteque pour un meilleurs parse, PDF.js #5 2026-06-23 18:09:30 +02:00
6 changed files with 4901 additions and 80 deletions

11
jest.config.js Normal file
View File

@@ -0,0 +1,11 @@
const { createDefaultPreset } = require("ts-jest");
const tsJestTransformCfg = createDefaultPreset().transform;
/** @type {import("jest").Config} **/
module.exports = {
testEnvironment: "node",
transform: {
...tsJestTransformCfg,
},
};

4743
package-lock.json generated

File diff suppressed because it is too large Load Diff

View File

@@ -11,18 +11,22 @@
"type": "commonjs",
"main": "index.js",
"scripts": {
"test": "echo \"Error: no test specified\" && exit 1",
"test": "jest",
"server": "nodemon ./src/server.ts"
},
"dependencies": {
"dotenv": "^17.4.2",
"express": "^5.2.1",
"pdf-parse-fork": "^1.2.0"
"pdf-parse-fork": "^1.2.0",
"pdfjs-dist": "^3.11.174"
},
"devDependencies": {
"@types/express": "^5.0.6",
"@types/jest": "^30.0.0",
"@types/node": "^25.9.3",
"jest": "^30.4.2",
"nodemon": "^3.1.14",
"ts-jest": "^29.4.11",
"ts-node": "^10.9.2",
"typescript": "^6.0.3"
}

View File

@@ -1,102 +1,143 @@
const fs = require('fs');
const pdfParse = require('pdf-parse-fork');
import * as fs from 'fs';
const pdfjsLib = require('pdfjs-dist');
function pdf_parse(travel: string){
interface PdfData {
text: string;
async function pdf_parse(travel: string) {
interface product_details {
quantity: number;
price_ht: number;
tva: string;
}
let fournisseur = '';
let date = '';
interface DetailProduit {
quantité: number;
prixHT: number;
TVA: string;
}
const productsList: { [key: string]: DetailProduit } = {};
interface tab_res {
marque: string;
date_achats: string;
interface res {
brand: string;
purchase_date: string;
products: {
[nomProduit: string]: DetailProduit;
[product_name: string]: product_details;
};
}
const product_list: { [key: string]: product_details } = {};
let supplier = '';
let date = '';
const dataBuffer = fs.readFileSync(travel);
const pdf_path = travel;
pdfParse(dataBuffer)
.then((data: PdfData) => {
// on regarde si c'est auchan ou metro
const regexAuchan = /auchan/i;
if (regexAuchan.test(data.text)) {
fournisseur = "Auchan"
// on regarde la date d'achat avec une expression reguliere pour auchan
const regexDate = /(\d{2})\/(\d{2})\/(\d{4})/;
const correspondance = data.text.match(regexDate);
if (correspondance) {
date = correspondance[0]
} else {
date = "non trouvé"
}
try {
// Lecture du fichier binaire du PDF et conversion pour PDF.js
const data_buffer = new Uint8Array(fs.readFileSync(pdf_path));
// on prend la liste des produits et leurs detail pour auchan
const lignes = data.text.split('\n');
// Chargement du document par PDF.js
const loading_task = pdfjsLib.getDocument({ data: data_buffer });
const pdf = await loading_task.promise;
let text = '';
// Boucle pour extraire le text de chaque page du PDF
for (let i = 1; i <= pdf.numPages; i++) {
const page = await pdf.getPage(i);
const text_content = await page.getTextContent();
// Expressions régulières pour détecter les lignes de produits Auchan
const regexLigneProduit = /^(\d{13})(?!\d)(.+?)(\d+,\d+)\s+(\d+)\s+(\d+,\d+)\s+(\d+,\d+)\s+(\d+,\d+)$/;
// On récupère chaque fragment de text trouvé graphiquement sur la page et on les sépare par un saut de ligne
const text_page = text_content.items.map((item: any) => item.str).join('\n');
text += text_page + '\n';
}
const regex_auchan = /auchan/i.test(text);
lignes.forEach((ligne: string) => {
const match = ligne.trim().match(regexLigneProduit);
if (match) {
const nomProduit = match[1].trim();
const quantite = parseInt(match[4], 10);
const prixHT = parseFloat(match[2].replace(',', '.'));
const tva = match[6].replace(',', '.') + "%";
productsList[nomProduit] = {
quantité: quantite,
prixHT: prixHT,
TVA: tva
};
}
});
// on regarde si c'est auchan ou metro
if (regex_auchan) {
supplier = "Auchan";
// on regarde la date d'achat avec une expression reguliere pour auchan
const regex_date = /(\d{2})\/(\d{2})\/(\d{4})/;
const corres = text.match(regex_date);
if (corres) {
date = corres[0]
} else {
fournisseur = "Metro"
date = "non trouvé"
}
// on regarde la date d'achat avec une expression reguliere pour metro
const regexDate = /(\d{2})-(\d{2})-(\d{4})/;
const correspondance = data.text.match(regexDate);
if (correspondance) {
date = correspondance[0]
} else {
date = "non trouvé"
// Découpage en lignes pour l'analyse et cration d'un tableau de toutes les lignes
const lines = text.split('\n').map(l => l.trim()).filter(l => l.length > 0);
// Algorithme de recherche verticale pour Auchan
for (let i = 0; i < lines.length; i++) {
// Si la ligne correspond exactement à un code-barres à 13 chiffres
if (/^\d{13}$/.test(lines[i])) {
const product_name = lines[i + 1];
const qte = lines[i + 3];
const price = lines[i + 4];
const tva = lines[i + 5];
product_list[product_name] = {
quantity: parseInt(qte, 10),
price_ht: parseFloat(price.replace(',', '.')),
tva: tva.replace(',', '.').trim() + "%"
};
}
}
// on renvoie les valeur avec un seul objet
} else {
supplier = "METRO";
const res : tab_res = {
marque: fournisseur,
date_achats: date,
products: productsList
// on regarde la date d'achat avec une expression reguliere pour metro
const regex_date = /(\d{2})-(\d{2})-(\d{4})/;
const corres = text.match(regex_date);
if (corres) {
date = corres[0];
} else {
date = "non trouvé";
}
console.log(res);
})
// Découpage en lignes pour l'analyse et cration d'un tableau de toutes les lignes
const lines = text.split('\n').map(l => l.trim()).filter(l => l.length > 0);
// Algorithme de recherche verticale pour metro
for (let i = 0; i < lines.length; i++) {
// Si la ligne correspond exactement à un code-barres à 13 chiffres
if (/^\d{13}$/.test(lines[i])) {
const product_name = lines[i + 1];
const qte = lines[i + 4];
const price = lines[i + 5];
const tva = lines[i + 6];
let tva_final = "";
if (tva == "B"){
tva_final = "5.5%";
}
else {
tva_final = "20%";
}
.catch((error: unknown) => {
console.error("Erreur :", error);
});
product_list[product_name] = {
quantity: parseInt(qte, 10),
price_ht: parseFloat(price.replace(',', '.')),
tva: tva_final
};
}
}
}
// Construction de l'objet final
const result: res = {
brand: supplier,
purchase_date: date,
products: product_list
};
console.log(result);
return result;
} catch (e) {
console.error("Erreur :", e);
}
}
export default pdf_parse;

25
tests/test_parse.test.ts Normal file
View File

@@ -0,0 +1,25 @@
import pdf_parse from "../src/modules/pdf-parse";
// utilisation de jest pour faire les tests
describe('Test du parser de factures (pdf_parse)', () => {
it('doit correctement parser la facture Metro et extraire les produits', async () => {
// test pour les fichier metro
const cheminPDF = "00(014)0057010856.pdf";
const resultat = await pdf_parse(cheminPDF);
expect(resultat!.brand).toBe("METRO");
expect(resultat!.purchase_date).toBe("22-04-2026");
expect(resultat!.products).toHaveProperty("2015675 SCHWEPPES POMME SLIM 33CL");
});
it('doit correctement parser une facture Auchan', async () => {
// test pour les fichier auchan
const cheminPDF = "2026-02-25 _ Facture AUCHAN _ Soupe.pdf";
const resultat = await pdf_parse(cheminPDF);
expect(resultat!.brand).toBe("Auchan");
expect(resultat!.purchase_date).toBe("25/02/2026");
expect(resultat!.products).toHaveProperty("PURSOUP VELOUTE LEGUMES SOLEIL");
});
});

View File

@@ -7,7 +7,8 @@
"esModuleInterop": true,
"forceConsistentCasingInFileNames": true,
"strict": true,
"skipLibCheck": true
"skipLibCheck": true,
"types": ["jest", "node"]
},
"include": ["src/**/*"],
"exclude": ["dist", "node_modules"]