model

Browse files

Files changed (13) hide show

.gitattributes +1 -0
README.md +0 -0
config.json +3 -0
conversion_config.json +3 -0
convert.py +70 -0
onnx/model.onnx +3 -0
onnx/model_int8.onnx +3 -0
onnx/model_uint8.onnx +3 -0
special_tokens_map.json +3 -0
test_local.py +49 -0
test_teradata.py +106 -0
tokenizer.json +3 -0
tokenizer_config.json +3 -0

.gitattributes CHANGED Viewed

@@ -7,6 +7,7 @@
 *.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.joblib filter=lfs diff=lfs merge=lfs -text
 *.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.mlmodel filter=lfs diff=lfs merge=lfs -text
 *.model filter=lfs diff=lfs merge=lfs -text

 *.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.joblib filter=lfs diff=lfs merge=lfs -text
+*.json filter=lfs diff=lfs merge=lfs -text
 *.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.mlmodel filter=lfs diff=lfs merge=lfs -text
 *.model filter=lfs diff=lfs merge=lfs -text

README.md CHANGED Viewed

The diff for this file is too large to render. See raw diff

config.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:bb68c77b52830c2223b9ad69b8a0473f49f06c930cf8fc34279eeddfb8230b47
+size 1159

conversion_config.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1916c336ce8c725cb58e53cc53da3511fc4404781b5db05666206426d2505c30
+size 303

convert.py ADDED Viewed

	@@ -0,0 +1,70 @@

+import os
+import json
+import shutil
+from optimum.exporters.onnx import main_export
+import onnx
+from onnxconverter_common import float16
+import onnxruntime as rt
+from onnxruntime.tools.onnx_model_utils import *
+from onnxruntime.quantization import quantize_dynamic, QuantType
+from huggingface_hub import hf_hub_download
+with open('conversion_config.json') as json_file:
+    conversion_config = json.load(json_file)
+    model_id = conversion_config["model_id"]
+    number_of_generated_embeddings = conversion_config["number_of_generated_embeddings"]
+    precision_to_filename_map = conversion_config["precision_to_filename_map"]
+    opset = conversion_config["opset"]
+    IR = conversion_config["IR"]
+    op = onnx.OperatorSetIdProto()
+    op.version = opset
+    if not os.path.exists("onnx"):
+        os.makedirs("onnx")
+    if "fp32" in precision_to_filename_map:
+        print("Exporting the fp32 onnx file...")
+        filename = precision_to_filename_map['fp32']
+        hf_hub_download(repo_id=model_id, filename=filename, local_dir = "./")
+        model = onnx.load(filename)
+        model_fixed = onnx.helper.make_model(model.graph, ir_version = IR, opset_imports = [op]) #to be sure that we have compatible opset and IR version
+        onnx.save(model_fixed, filename)
+        print("Done\n\n")
+    if "int8" in precision_to_filename_map:
+        print("Exporting the int8 onnx file...")
+        filename = precision_to_filename_map['int8']
+        hf_hub_download(repo_id=model_id, filename=filename, local_dir = "./")
+        model = onnx.load(filename)
+        model_fixed = onnx.helper.make_model(model.graph, ir_version = IR, opset_imports = [op]) #to be sure that we have compatible opset and IR version
+        onnx.save(model_fixed, filename)
+        print("Done\n\n")
+    if "uint8" in precision_to_filename_map:
+        print("Exporting the uint8 onnx file...")
+        filename = precision_to_filename_map['uint8']
+        hf_hub_download(repo_id=model_id, filename=filename, local_dir = "./")
+        model = onnx.load(filename)
+        model_fixed = onnx.helper.make_model(model.graph, ir_version = IR, opset_imports = [op]) #to be sure that we have compatible opset and IR version
+        onnx.save(model_fixed, filename)
+        print("Done\n\n")

onnx/model.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:74e517b6cb7efdd20e7c310ce49c851ff81c2a61684133f2f7a229e4b1e2b94c
+size 1226099897

onnx/model_int8.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7e1dc692af82258063ff777f3151e86d412bfcfe0edb2047605ed92f4dccf486
+size 310916005

onnx/model_uint8.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:fbbcbce0ee6d3e0e059162b12258cd16d48311ab6aea23b7f8c72515a908763d
+size 310916005

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8c785abebea9ae3257b61681b4e6fd8365ceafde980c21970d001e834cf10835
+size 964

test_local.py ADDED Viewed

	@@ -0,0 +1,49 @@

+import onnxruntime as rt
+from sentence_transformers.util import cos_sim
+from sentence_transformers import SentenceTransformer
+import transformers
+import gc
+import json
+with open('conversion_config.json') as json_file:
+    conversion_config = json.load(json_file)
+    model_id = conversion_config["model_id"]
+    number_of_generated_embeddings = conversion_config["number_of_generated_embeddings"]
+    precision_to_filename_map = conversion_config["precision_to_filename_map"]
+    sentences_1 = 'How is the weather today?'
+    sentences_2 = 'What is the current weather like today?'
+    print(f"Testing on cosine similiarity between sentences: \n'{sentences_1}'\n'{sentences_2}'\n\n\n")
+    tokenizer = transformers.AutoTokenizer.from_pretrained("./")
+    enc1 = tokenizer(sentences_1)
+    enc2 = tokenizer(sentences_2)
+    for precision, file_name in precision_to_filename_map.items():
+        onnx_session = rt.InferenceSession(file_name)
+        embeddings_1_onnx = onnx_session.run(None,     {"input_ids": [enc1.input_ids],
+             "attention_mask": [enc1.attention_mask]})[1][0]
+        embeddings_2_onnx = onnx_session.run(None,     {"input_ids": [enc2.input_ids],
+             "attention_mask": [enc2.attention_mask]})[1][0]
+        del onnx_session
+        gc.collect()
+        print(f'Cosine similiarity for ONNX model with precision "{precision}" is {str(cos_sim(embeddings_1_onnx, embeddings_2_onnx))}')
+    model = SentenceTransformer(model_id, trust_remote_code=True)
+    embeddings_1_sentence_transformer = model.encode(sentences_1, normalize_embeddings=True, trust_remote_code=True)
+    embeddings_2_sentence_transformer = model.encode(sentences_2, normalize_embeddings=True, trust_remote_code=True)
+    print('Cosine similiarity for original sentence transformer model is '+str(cos_sim(embeddings_1_sentence_transformer, embeddings_2_sentence_transformer)))

test_teradata.py ADDED Viewed

	@@ -0,0 +1,106 @@

+import sys
+import teradataml as tdml
+from tabulate import tabulate
+import json
+with open('conversion_config.json') as json_file:
+    conversion_config = json.load(json_file)
+    model_id = conversion_config["model_id"]
+    number_of_generated_embeddings = conversion_config["number_of_generated_embeddings"]
+    precision_to_filename_map = conversion_config["precision_to_filename_map"]
+    host = sys.argv[1]
+    username = sys.argv[2]
+    password = sys.argv[3]
+    print("Setting up connection to teradata...")
+    tdml.create_context(host = host, username = username, password = password)
+    print("Done\n\n")
+    print("Deploying tokenizer...")
+    try:
+        tdml.db_drop_table('tokenizer_table')
+    except:
+        print("Can't drop tokenizers table - it's not existing")
+    tdml.save_byom('tokenizer',
+                  'tokenizer.json',
+                  'tokenizer_table')
+    print("Done\n\n")
+    print("Testing models...")
+    try:
+        tdml.db_drop_table('model_table')
+    except:
+        print("Can't drop models table - it's not existing")
+    for precision, file_name in precision_to_filename_map.items():
+        print(f"Deploying {precision} model...")
+        tdml.save_byom(precision,
+                      file_name,
+                      'model_table')
+        print(f"Model {precision} is deployed\n")
+        print(f"Calculating embeddings with {precision} model...")
+        try:
+            tdml.db_drop_table('emails_embeddings_store')
+        except:
+            print("Can't drop embeddings table - it's not existing")
+        tdml.execute_sql(f"""
+            create volatile table emails_embeddings_store as (
+                select
+                    *
+            from mldb.ONNXEmbeddings(
+                    on emails.emails as InputTable
+                    on (select * from model_table where model_id = '{precision}') as ModelTable DIMENSION
+                    on (select model as tokenizer from tokenizer_table where model_id = 'tokenizer') as TokenizerTable DIMENSION
+                    using
+                        Accumulate('id', 'txt')
+                        ModelOutputTensor('sentence_embedding')
+                        EnableMemoryCheck('false')
+                        OutputFormat('FLOAT32({number_of_generated_embeddings})')
+                        OverwriteCachedModel('true')
+                ) a
+        ) with data on commit preserve rows
+        """)
+        print("Embeddings calculated")
+        print(f"Testing semantic search with cosine similiarity on the output of the model with precision '{precision}'...")
+        tdf_embeddings_store = tdml.DataFrame('emails_embeddings_store')
+        tdf_embeddings_store_tgt = tdf_embeddings_store[tdf_embeddings_store.id == 3]
+        tdf_embeddings_store_ref = tdf_embeddings_store[tdf_embeddings_store.id != 3]
+        cos_sim_pd = tdml.DataFrame.from_query(f"""
+            SELECT
+                dt.target_id,
+                dt.reference_id,
+                e_tgt.txt as target_txt,
+                e_ref.txt as reference_txt,
+                (1.0 - dt.distance) as similiarity
+            FROM
+                TD_VECTORDISTANCE (
+                    ON ({tdf_embeddings_store_tgt.show_query()}) AS TargetTable
+                    ON ({tdf_embeddings_store_ref.show_query()}) AS ReferenceTable DIMENSION
+                    USING
+                        TargetIDColumn('id')
+                        TargetFeatureColumns('[emb_0:emb_{number_of_generated_embeddings - 1}]')
+                        RefIDColumn('id')
+                        RefFeatureColumns('[emb_0:emb_{number_of_generated_embeddings - 1}]')
+                        DistanceMeasure('cosine')
+                        topk(3)
+                ) AS dt
+            JOIN emails.emails e_tgt on e_tgt.id = dt.target_id
+            JOIN emails.emails e_ref on e_ref.id = dt.reference_id;
+            """).to_pandas()
+        print(tabulate(cos_sim_pd, headers='keys', tablefmt='fancy_grid'))
+        print("Done\n\n")
+    tdml.remove_context()

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:883b037111086fd4dfebbbc9b7cee11e1517b5e0c0514879478661440f137085
+size 17082987

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c826b85ddb981faae7251de7bd9195140665c52ac6c313a1cd9c4d9ba040140c
+size 1370