do not count words when in reverse-only mode

author Sarah Hoffmann <lonvia@denofr.de>

Tue, 26 Oct 2021 09:42:42 +0000 (11:42 +0200)

committer Sarah Hoffmann <lonvia@denofr.de>

Tue, 26 Oct 2021 10:00:13 +0000 (12:00 +0200)
author Sarah Hoffmann <lonvia@denofr.de>
Tue, 26 Oct 2021 09:42:42 +0000 (11:42 +0200)
committer Sarah Hoffmann <lonvia@denofr.de>
Tue, 26 Oct 2021 10:00:13 +0000 (12:00 +0200)
diff --git a/nominatim/tokenizer/icu_tokenizer.py b/nominatim/tokenizer/icu_tokenizer.py

index e7ee57ad197b5879187a5070a97c07e544c5f8f1..3331a3210aaba70d49b602299c2ce9e88238a3a0 100644 (file)
--- a/nominatim/tokenizer/icu_tokenizer.py
+++ b/nominatim/tokenizer/icu_tokenizer.py
@@ -99,18 +99,19 @@ class LegacyICUTokenizer(AbstractTokenizer):
          """ Recompute frequencies for all name words.
          """
          with connect(self.dsn) as conn:
          """ Recompute frequencies for all name words.
          """
          with connect(self.dsn) as conn:
-            with conn.cursor() as cur:
-                cur.drop_table("word_frequencies")
-                LOG.info("Computing word frequencies")
-                cur.execute("""CREATE TEMP TABLE word_frequencies AS
-                                 SELECT unnest(name_vector) as id, count(*)
-                                 FROM search_name GROUP BY id""")
-                cur.execute("CREATE INDEX ON word_frequencies(id)")
-                LOG.info("Update word table with recomputed frequencies")
-                cur.execute("""UPDATE word
-                               SET info = info || jsonb_build_object('count', count)
-                               FROM word_frequencies WHERE word_id = id""")
-                cur.drop_table("word_frequencies")
+            if conn.table_exists('search_name'):
+                with conn.cursor() as cur:
+                    cur.drop_table("word_frequencies")
+                    LOG.info("Computing word frequencies")
+                    cur.execute("""CREATE TEMP TABLE word_frequencies AS
+                                     SELECT unnest(name_vector) as id, count(*)
+                                     FROM search_name GROUP BY id""")
+                    cur.execute("CREATE INDEX ON word_frequencies(id)")
+                    LOG.info("Update word table with recomputed frequencies")
+                    cur.execute("""UPDATE word
+                                   SET info = info || jsonb_build_object('count', count)
+                                   FROM word_frequencies WHERE word_id = id""")
+                    cur.drop_table("word_frequencies")
              conn.commit()
  
  
              conn.commit()
  
  
diff --git a/nominatim/tokenizer/legacy_tokenizer.py b/nominatim/tokenizer/legacy_tokenizer.py

index d901a68d2e53f77e5c96210c11ede863e7e5e36f..0edcdccaaa8a6b7471b4eb38fb710f7db4924d71 100644 (file)
--- a/nominatim/tokenizer/legacy_tokenizer.py
+++ b/nominatim/tokenizer/legacy_tokenizer.py
@@ -190,18 +190,19 @@ class LegacyTokenizer(AbstractTokenizer):
          """ Recompute the frequency of full words.
          """
          with connect(self.dsn) as conn:
          """ Recompute the frequency of full words.
          """
          with connect(self.dsn) as conn:
-            with conn.cursor() as cur:
-                cur.drop_table("word_frequencies")
-                LOG.info("Computing word frequencies")
-                cur.execute("""CREATE TEMP TABLE word_frequencies AS
-                                 SELECT unnest(name_vector) as id, count(*)
-                                 FROM search_name GROUP BY id""")
-                cur.execute("CREATE INDEX ON word_frequencies(id)")
-                LOG.info("Update word table with recomputed frequencies")
-                cur.execute("""UPDATE word SET search_name_count = count
-                               FROM word_frequencies
-                               WHERE word_token like ' %' and word_id = id""")
-                cur.drop_table("word_frequencies")
+            if conn.table_exists('search_name'):
+                with conn.cursor() as cur:
+                    cur.drop_table("word_frequencies")
+                    LOG.info("Computing word frequencies")
+                    cur.execute("""CREATE TEMP TABLE word_frequencies AS
+                                     SELECT unnest(name_vector) as id, count(*)
+                                     FROM search_name GROUP BY id""")
+                    cur.execute("CREATE INDEX ON word_frequencies(id)")
+                    LOG.info("Update word table with recomputed frequencies")
+                    cur.execute("""UPDATE word SET search_name_count = count
+                                   FROM word_frequencies
+                                   WHERE word_token like ' %' and word_id = id""")
+                    cur.drop_table("word_frequencies")
              conn.commit()
  
      def name_analyzer(self):
              conn.commit()
  
      def name_analyzer(self):
author	Sarah Hoffmann <lonvia@denofr.de>
	Tue, 26 Oct 2021 09:42:42 +0000 (11:42 +0200)
committer	Sarah Hoffmann <lonvia@denofr.de>
	Tue, 26 Oct 2021 10:00:13 +0000 (12:00 +0200)
nominatim/tokenizer/icu_tokenizer.py		patch \| blob \| history
nominatim/tokenizer/legacy_tokenizer.py		patch \| blob \| history