Merge pull request #2396 from lonvia/partial-word-token

[nominatim.git] / lib-php / tokenizer / legacy_tokenizer.php
diff --git a/lib-php/tokenizer/legacy_tokenizer.php b/lib-php/tokenizer/legacy_tokenizer.php

index 0fb37fd09ba7a34ffec578e00529121fd754c7c8..064b41667a9322bb6cb164dd6f7bb041490d1257 100644 (file)
--- a/lib-php/tokenizer/legacy_tokenizer.php
+++ b/lib-php/tokenizer/legacy_tokenizer.php
@@ -105,7 +105,7 @@ class Tokenizer
          // now compute all possible tokens
          $aWordLists = array();
          $aTokens = array();
-        foreach ($aNormPhrases as $sTitle => $sPhrase) {
+        foreach ($aNormPhrases as $sPhrase) {
              if (strlen($sPhrase) > 0) {
                  $aWords = explode(' ', $sPhrase);
                  Tokenizer::addTokens($aTokens, $aWords);
@@ -137,14 +137,14 @@ class Tokenizer
  
              // Try more interpretations for Tokens that could not be matched.
              foreach ($aTokens as $sToken) {
-                if ($sToken[0] == ' ' && !$oValidTokens->contains($sToken)) {
-                    if (preg_match('/^ ([0-9]{5}) [0-9]{4}$/', $sToken, $aData)) {
+                if ($sToken[0] != ' ' && !$oValidTokens->contains($sToken)) {
+                    if (preg_match('/^([0-9]{5}) [0-9]{4}$/', $sToken, $aData)) {
                          // US ZIP+4 codes - merge in the 5-digit ZIP code
                          $oValidTokens->addToken(
                              $sToken,
                              new Token\Postcode(null, $aData[1], 'us')
                          );
-                    } elseif (preg_match('/^ [0-9]+$/', $sToken)) {
+                    } elseif (preg_match('/^[0-9]+$/', $sToken)) {
                          // Unknown single word token with a number.
                          // Assume it is a house number.
                          $oValidTokens->addToken(
@@ -212,17 +212,29 @@ class Tokenizer
                  ) {
                      $oToken = new Token\Country($iId, $aWord['country_code']);
                  }
-            } else {
+            } elseif ($aWord['word_token'][0] == ' ') {
                  $oToken = new Token\Word(
                      $iId,
-                    $aWord['word_token'][0] != ' ',
                      (int) $aWord['count'],
                      substr_count($aWord['word_token'], ' ')
                  );
+            // For backward compatibility: ignore all partial tokens with more
+            // than one word.
+            } elseif (strpos($aWord['word_token'], ' ') === false) {
+                $oToken = new Token\Partial(
+                    $iId,
+                    $aWord['word_token'],
+                    (int) $aWord['count']
+                );
              }
  
              if ($oToken) {
-                $oValidTokens->addToken($aWord['word_token'], $oToken);
+                // remove any leading spaces
+                if ($aWord['word_token'][0] == ' ') {
+                    $oValidTokens->addToken(substr($aWord['word_token'], 1), $oToken);
+                } else {
+                    $oValidTokens->addToken($aWord['word_token'], $oToken);
+                }
              }
          }
      }