Project:

Villanova

Company:

Villanova.ai

Open Source License:

ODC-BY-1.0


Functionality

Dataset-Multilingual Dialogues is generated starting the original SODA dataset. Original dataset is a triples regarding social interactions extracted and contextualized to get a short narrative, which is used as a prompt to generate everyday conversations. The We generated 12,000 synthetic dialogues per language in French, German, Italian and Spanish. This results in a multilingual dataset that mirrors the SODA style while being fully based on open-source generation methods

IPCEI-CIS Referene Architecture

AI Layer, Data Layer

Keywords

6-to-8-turn-conversations, chat-dataset, chat-model-training, chatbot-training-data, cleaned-dataset, commonsense-reasoning, conversational-ai-training, conversational-dataset, cross-lingual-data, deduplicated-data, dialogue-generation, dialogue-systems, english-language, european-languages, filtered-synthetic-data, french-language, german-language, GPT-generated-data, high-quality-synthetic-corpus, instruction-finetuning, instruction-style-dialogue, italian-language, language-adaptation, LLM-curated-dataset, LLM-fine-tuning, LLM-generated-data, multi-speaker-dialogue, multi-turn-dialogue, multilingual-chatbot, multilingual-dialogue, multilingual-nlp, narrative-to-dialogue, open-dataset, response-generation, social-commonsense, SODA-pipeline, spanish-language, structured-dialogue, synthetic-data-generation, synthetic-dialogue, text-generation-dataset