BERT With Zero Overhead
Run BERT on remote machines with 1ms overhead.
Why BERT?
How to deploy BERT on Everinfer
!python3 -m transformers.onnx --model=distilbert-base-uncased onnx/from everinfer import Client
client = Client('my_api_key')
pipeline = client.register_pipeline('bert', ['onnx/model.onnx'])
runner = client.create_engine(pipeline['uuid'])from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("distilbert-base-uncased")
inputs = tokenizer("Everinfer is fast af", return_tensors="np")Performance

Last updated