Алгоритми токенізації великих мовних моделей
Вантажиться...
Файли
Дата
Автори
Назва журналу
Номер ISSN
Назва тому
DOI
Анотація
This work is dedicated to the review of algorithms for text tokenization of modern large language models
Опис
Ключові слова
УДК
Тип документа
Мова
ISSN
Бібліографічний опис
Довгань О. А., Овчинников К. В. Алгоритми токенізації великих мовних моделей // Матеріали Всеукраїнської науково-практичної інтернет-конференції «Молодь в науці: дослідження, проблеми, перспективи (МН-2025)», Вінниця, 15-16 червня 2025 р. Електрон. текст. дані. Вінниця, 2025. URI: https://conferences.vntu.edu.ua/index.php/mn/mn2025/paper/download/22783.
Схвалення
Рецензія
Доповнено
Цитується в
Список використаної літератури (7)
- What is Tokenization? [Електронний ресурс] – Режим доступу: https://www.datacamp.com/blog/what-is-tokenization
- Tokenizer Choice For LLM Training: Negligible or Crucial? [Електронний ресурс] – Режим доступу: https://aclanthology.org/2024.findings-naacl.247/
- Neural Machine Translation of Rare Words with Subword Units [Електронний ресурс] – Режим доступу: https://arxiv.org/abs/1508.07909v5
- Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation [Електронний ресурс] – Режим доступу: https://arxiv.org/abs/1609.08144v2
- SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing [Електронний ресурс] – Режим доступу: https://arxiv.org/abs/1808.06226v1
- tiktoken [Електронний ресурс] – Режим доступу: https://github.com/openai/tiktoken
- The Llama 3 Herd of Models [Електронний ресурс] – Режим доступу: https://arxiv.org/abs/2407.21783