Flitto provides comprehensive high-quality data for advancing LLMs, agents, multimodal models, and physical AI models, going beyond simple text-based language data.
1. Text & Language Data (Text & Parallel Corpora)
- Multilingual parallel corpora and SFT data: High-quality instruction-following data for fine-tuning (Instruction-Tuning)
- Domain-specialized data: High-difficulty professional knowledge datasets including Coding, STEM, legal, medical, and financial domains
2. Multimodal Data
- Audio/Speech: Speech recognition (ASR), synthesis (TTS), speech-to-speech conversation (S2S), and multilingual code-switching audio and transcription data
- Vision & Document: OCR data for physical documents (receipts, forms, contracts, etc.), and image-text pair data for Vision-Language Model (VLM) training
3. Agent & Reasoning Data
- Agent trajectory data: Behavioral trajectory data to train AI agents in complex problem-solving, long-horizon planning, and tool utilization
4. Physical AI & RFM Data (Robot Foundation Model)
- Robot behavioral trajectories and control data: Sensor-actuator data, spatiotemporal trajectories, object manipulation and navigation learning data for robots
- RFM multimodal data: Vision-text-control signal pairing data for training robot Vision-Language-Action (VLA) models