Din seria dezvoltarea proiectului presslook.comPrima variantă de păstrare a datelor privind cuvintele cheie găsite într-un text(în cazul nostru știre) consta în următoarele câmpuri:
  • ID stire;
  • ID cuvânt-cheie;
  • Count - numărul de apariții a cuvântului în știre;
  • altele mai puțin importante...
După o analiză în timp, am observat că e destul de complicat să depistez cuvintele cheie cu adevărat relevante dintr-o știre, și asta fiindcă ordonarea lor era posibilă doar după numărul de apariții a cuvântului într-o știre. De multe ori, cuvintele cele mai importante putea apărea doar de 1-2 ori în titlu sau la începutul știi și gata.
Am decis ca pentru fiecare cuvânt găsit într-o știre să mai am:
  • Index - pozitia cea mai bună a cuvântului în text;
  • Length - lungimea textului în care s-a căutat cuvântul.
Astfel pot crea o formulă mult mai eficientă după care să ordonez cuvintele cheie găsite într-o știre. Ca rezultat se evidențiază cuvintele cu adevărat relevante.
O pagină de testare (temporară) este disponibilă aici - se poate introduce un text în care doriți să căutați cuvinte chaie, și primiți rezultatele în una din 5 limbi alese(ro, ru, en, es, fr).
Un element foarte important în funcționarea sistemului este viteza de procesare a textului. La moment aceasta variaza între 0.1 - 0.5 secunde - viteza depinde de lungimea textului cercetat și numărul de cuvinte cheie existente în sistem.