GPT2: 900+RPS
Run GPT-2 at 900+RPS and 6ms latency!
Preparation
!python3 -m transformers.onnx --model=gpt2 onnx/from transformers import AutoTokenizer
tokenizer = AutoTokenizer.from_pretrained("gpt2")
inputs = tokenizer("Everinfer is blazing fast! Please contact us at hello@everinfer.ai to try it out!",
return_tensors="np")Using Everinfer
from everinfer import Client
client = Client('my_key')
pipeline = client.register_pipeline('gpt2', ['onnx/model.onnx'])Last updated