feat: update model to sentence-transformers version

Files changed (10) hide show

1_Pooling/config.json ADDED Viewed

+{
+  "word_embedding_dimension": 1024,
+  "pooling_mode_cls_token": false,
+  "pooling_mode_mean_tokens": true,
+  "pooling_mode_max_tokens": false,
+  "pooling_mode_mean_sqrt_len_tokens": false
+}

README.md CHANGED Viewed

@@ -15,6 +15,9 @@ tags:
 - retriever
 - pruned
 - e5
 ---
 # E5-large-en-ru
@@ -33,6 +36,10 @@ Uses only russian and english tokens.
 ## Usage
 ```python
 import torch.nn.functional as F
 from torch import Tensor
@@ -63,4 +70,33 @@ embeddings = F.normalize(embeddings, p=2, dim=1)
 scores = (embeddings[:2] @ embeddings[2:].T) * 100
 print(scores.tolist())
 # [[68.59542846679688, 81.75910949707031], [80.36100769042969, 64.77748107910156]]
 ```

 - retriever
 - pruned
 - e5
+- sentence-transformers
+- feature-extraction
+- sentence-similarity
 ---
 # E5-large-en-ru
 ## Usage
+### transformers
+#### Direct usage
 ```python
 import torch.nn.functional as F
 from torch import Tensor
 scores = (embeddings[:2] @ embeddings[2:].T) * 100
 print(scores.tolist())
 # [[68.59542846679688, 81.75910949707031], [80.36100769042969, 64.77748107910156]]
+```
+#### Pipeline
+```python
+from transformers import pipeline
+pipe = pipeline('feature-extraction', model='d0rj/e5-large-en-ru')
+embeddings = pipe(input_texts, return_tensors=True)
+embeddings[0].size()
+# torch.Size([1, 17, 1024])
+```
+### sentence-transformers
+```python
+from sentence_transformers import SentenceTransformer
+sentences = [
+    'query: Что такое круглые тензоры?',
+    'passage: Abstract: we introduce a novel method for compressing round tensors based on their inherent radial symmetry. We start by generalising PCA and eigen decomposition on round tensors...'б
+]
+model = SentenceTransformer('d0rj/e5-large-en-ru')
+embeddings = model.encode(sentences, convert_to_tensor=True)
+embeddings.size()
+# torch.Size([2, 1024])
 ```

config.json CHANGED Viewed

@@ -21,7 +21,7 @@
   "pad_token_id": 1,
   "position_embedding_type": "absolute",
   "torch_dtype": "float32",
-  "transformers_version": "4.25.1",
   "type_vocab_size": 1,
   "use_cache": true,
   "vocab_size": 60302

   "pad_token_id": 1,
   "position_embedding_type": "absolute",
   "torch_dtype": "float32",
+  "transformers_version": "4.30.1",
   "type_vocab_size": 1,
   "use_cache": true,
   "vocab_size": 60302

config_sentence_transformers.json ADDED Viewed

+{
+  "__version__": {
+    "sentence_transformers": "2.2.2",
+    "transformers": "4.30.1",
+    "pytorch": "1.12.1"
+  }
+}

modules.json ADDED Viewed

+[
+  {
+    "idx": 0,
+    "name": "0",
+    "path": "",
+    "type": "sentence_transformers.models.Transformer"
+  },
+  {
+    "idx": 1,
+    "name": "1",
+    "path": "1_Pooling",
+    "type": "sentence_transformers.models.Pooling"
+  },
+  {
+    "idx": 2,
+    "name": "2",
+    "path": "2_Normalize",
+    "type": "sentence_transformers.models.Normalize"
+  }
+]

pytorch_model.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:b057df4cbbcccfe1bec23d948afcebee3727b4b88a8ae17a0cc992467e5498a1
-size 1462712045

 version https://git-lfs.github.com/spec/v1
+oid sha256:a900d8829b407aaadc83b6315504ba1acdfde420b5e2288c706a0215c6b11ddb
+size 1462678449

sentence_bert_config.json ADDED Viewed

+{
+  "max_seq_length": 514,
+  "do_lower_case": false
+}

special_tokens_map.json ADDED Viewed

+{
+  "bos_token": "<s>",
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "mask_token": {
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "unk_token": "<unk>"
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

+{
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "<s>",
+  "eos_token": "</s>",
+  "mask_token": {
+    "__type": "AddedToken",
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "sp_model_kwargs": {},
+  "tokenizer_class": "XLMRobertaTokenizer",
+  "unk_token": "<unk>"
+}