Bộ dữ liệu ngôn ngữ Ả Rập & Thái Lan & Việt Nam & Hindi & Anh & Trung Quốc
Bộ dữ liệu nhận dạng văn bản đa dạng cho các ứng dụng OCR nâng cao: Biển báo, Thực đơn và nhiều hơn nữa
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 150k
Chú thích: Có
Mô tả: Bộ dữ liệu ngôn ngữ tiếng Ả Rập, tiếng Thái, tiếng Việt, tiếng Hindi, tiếng Anh và tiếng Trung Quốc.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 1k
Chú thích: Có
Mô tả: Bộ dữ liệu văn bản tiếng Ả Rập chứa một tập hợp các mẫu văn bản được viết bằng tiếng Ả Rập. Nó bao gồm nhiều dạng nội dung khác nhau, chẳng hạn như bài báo, bài đăng trên mạng xã hội, văn học và hội thoại, trải rộng trên nhiều chủ đề và phong cách viết. Bộ dữ liệu này được sử dụng cho các tác vụ như xử lý ngôn ngữ tự nhiên (NLP), phân loại văn bản, phân tích cảm xúc và dịch máy trong các ứng dụng ngôn ngữ Ả Rập.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 38k
Chú thích: Có
Mô tả: Bộ dữ liệu ngôn ngữ tiếng Trung, tiếng Anh, tiếng Tây Tạng và tiếng Uyghur.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 60k
Chú thích: Có
Mô tả: Bộ dữ liệu thực đơn tiếng Trung và tiếng Anh chứa hình ảnh hoặc mẫu văn bản của thực đơn nhà hàng có cả tiếng Trung và tiếng Anh. Nó bao gồm nhiều phông chữ, bố cục và cấu trúc thực đơn khác nhau, trình bày tên món ăn, mô tả và giá cả bằng hai ngôn ngữ. Bộ dữ liệu này hữu ích cho các tác vụ như nhận dạng ký tự quang học (OCR), dịch máy và số hóa thực đơn trong môi trường đa ngôn ngữ.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 3k
Chú thích: Có
Mô tả: Bộ dữ liệu Văn bản Viết tay tiếng Trung chứa các mẫu văn bản viết tay tiếng Trung, bao gồm các bài luận, tiểu luận và các văn bản dài khác. Bộ dữ liệu này có nhiều kiểu chữ viết tay và mức độ phức tạp khác nhau, được sử dụng cho các tác vụ như nhận dạng chữ viết tay, phân tích văn bản và huấn luyện mô hình máy học.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 1k
Chú thích: Có
Mô tả: Bộ dữ liệu thông báo WIFI tiếng Trung bao gồm các mẫu văn bản được tìm thấy trong các thông báo và màn hình đăng nhập WIFI được viết bằng tiếng Trung. Nó thường bao gồm nhiều thông báo, hướng dẫn và thông báo lỗi liên quan đến việc kết nối hoặc quản lý mạng WIFI. Bộ dữ liệu này được sử dụng cho các tác vụ như nhận dạng văn bản, xử lý ngôn ngữ tự nhiên và cải thiện giao diện người dùng cho kết nối mạng.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 12k
Chú thích: Có
Mô tả: Bộ dữ liệu chữ viết tay tiếng Anh và tiếng Trung chứa các mẫu chữ viết tay bằng cả tiếng Anh và tiếng Trung, thể hiện nhiều phong cách viết và độ phức tạp của ký tự. Bộ dữ liệu này thường được sử dụng để huấn luyện và đánh giá các mô hình nhận dạng chữ viết tay, hỗ trợ phân tích văn bản đa ngôn ngữ và các nghiên cứu liên quan khác. Bộ dữ liệu bao gồm nhiều loại ký tự, chữ số, từ và câu trong cả hai ngôn ngữ.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 30k
Chú thích: Có
Mô tả: Bộ dữ liệu biển hiệu cửa hàng tiếng Anh và tiếng Trung bao gồm hình ảnh các biển hiệu cửa hàng có cả văn bản tiếng Anh và tiếng Trung. Nó ghi lại nhiều yếu tố biển hiệu khác nhau như tên cửa hàng, quảng cáo, khuyến mãi và chỉ dẫn, được hiển thị bằng nhiều phông chữ, kiểu dáng và định dạng khác nhau. Bộ dữ liệu này được sử dụng cho các tác vụ như phát hiện và nhận dạng văn bản, hiểu bối cảnh đa ngôn ngữ và cải thiện các mô hình thị giác máy tính để diễn giải biển hiệu song ngữ.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 50k
Chú thích: Có
Mô tả: Bộ dữ liệu văn bản góc đặc biệt tiếng Anh và tiếng Trung chứa hình ảnh văn bản được hiển thị ở nhiều góc độ và hướng khác nhau bằng cả tiếng Anh và tiếng Trung. Nó bao gồm văn bản từ các nguồn như biển báo, quảng cáo và tài liệu không được trình bày theo định dạng ngang tiêu chuẩn. Bộ dữ liệu này được sử dụng để huấn luyện và đánh giá các mô hình phát hiện và nhận dạng văn bản, đặc biệt là những mô hình có khả năng xử lý văn bản ở các hướng và góc nhìn không truyền thống.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 20k
Chú thích: Có
Mô tả: Bộ dữ liệu thực đơn tiếng Anh bao gồm hình ảnh hoặc mẫu văn bản của thực đơn nhà hàng được viết bằng tiếng Anh. Nó có nhiều kiểu chữ, bố cục và định dạng khác nhau, với nội dung từ tên món ăn đến mô tả và giá cả. Bộ dữ liệu này thường được sử dụng cho các tác vụ như nhận dạng ký tự quang học (OCR), trích xuất văn bản và số hóa thực đơn trong các ứng dụng liên quan đến thực phẩm.
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 33k
Chú thích: Có
Mô tả: Bộ dữ liệu Văn bản Cảnh tiếng Anh bao gồm các hình ảnh chứa cảnh thiên nhiên có nhúng văn bản tiếng Anh. Văn bản xuất hiện dưới nhiều hình thức khác nhau, chẳng hạn như biển báo, bảng quảng cáo và áp phích, thường có nhiều phông chữ, kích thước và hướng khác nhau. Bộ dữ liệu này thường được sử dụng để huấn luyện và kiểm thử các mô hình trong các tác vụ phát hiện, nhận dạng văn bản và hiểu cảnh.
Ứng dụng: Trí tuệ nhân tạo trong xử lý tài liệu
Định dạng: HEIC (hình ảnh) & .mov (video)
Số lượng: 94053
Chú thích: Không
Mô tả: Ảnh động với văn bản viết tay bằng tiếng Nhật, tiếng Hàn và tiếng Nga.
Thiết bị ghi hình: Camera iPhone & iPad
Điều kiện quay phim: - Ánh sáng mạnh/Chói - Bật đèn flash máy ảnh - Ánh sáng màu - Ánh sáng yếu, không bật đèn flash máy ảnh - Bình thường
Trường hợp sử dụng: Nhận dạng ký tự quang học (OCR)
Định dạng: Hình ảnh
Số lượng: 40k
Chú thích: Có
Mô tả: Bộ dữ liệu ngôn ngữ Nhật Bản và Hàn Quốc bao gồm các mẫu văn bản bằng cả tiếng Nhật và tiếng Hàn. Nó chứa nhiều nội dung khác nhau như câu, cụm từ và từ ngữ, bao gồm nhiều ngữ cảnh và phong cách. Bộ dữ liệu này được sử dụng cho các tác vụ như xử lý ngôn ngữ tự nhiên (NLP), dịch máy và phân tích văn bản trong các ứng dụng đa ngôn ngữ.
Ứng dụng: Trí tuệ nhân tạo trong xử lý tài liệu
Định dạng: HEIC (hình ảnh) & .mov (video)
Số lượng: 23930
Chú thích: Không
Mô tả: Ảnh động với văn bản viết tay bằng tiếng Nhật, tiếng Hàn và tiếng Nga.
Thiết bị ghi hình: Camera iPhone & iPad
Điều kiện quay phim: - Ánh sáng mạnh/Chói - Bật đèn flash máy ảnh - Ánh sáng màu - Ánh sáng yếu, không bật đèn flash máy ảnh - Bình thường
Trường hợp sử dụng: Văn bản + Âm thanh-Hình ảnh (Đa ngôn ngữ / Nhận dạng ký tự quang học / Xử lý ngôn ngữ tự nhiên)
Định dạng: Video
Số lượng: Hơn 100 video bài giảng + video PowerPoint định dạng dài
Chú thích: Không
Mô tả: Sách tiếng Trung, sách tiếng Anh, tạp chí, chính sách công, tiểu thuyết, sách thiếu nhi, sách nói và văn bản tiếng Quảng Đông, video bài giảng và slide PowerPoint, video dài. Nửa tỷ cuốn sách, câu hỏi và câu trả lời, bài báo.
Chúng tôi sử dụng cookie để cải thiện trải nghiệm của bạn trên trang web của chúng tôi. Bằng cách sử dụng trang web của chúng tôi, bạn đồng ý với cookie.
Quản lý tùy chọn cookie của bạn bên dưới:
Cookie thiết yếu cho phép các chức năng cơ bản và cần thiết cho chức năng phù hợp của trang web.
Trình quản lý thẻ Google giúp đơn giản hóa việc quản lý thẻ tiếp thị trên trang web của bạn mà không cần thay đổi mã.
Cookie thống kê thu thập thông tin ẩn danh. Thông tin này giúp chúng tôi hiểu cách khách truy cập sử dụng trang web của chúng tôi.
Google Analytics là một công cụ mạnh mẽ giúp theo dõi và phân tích lưu lượng truy cập trang web để đưa ra quyết định tiếp thị sáng suốt.
URL dịch vụ: policies.google.com (mở trong cửa sổ mới)
Cookie tiếp thị được sử dụng để theo dõi khách truy cập vào các trang web. Mục đích là hiển thị quảng cáo có liên quan và hấp dẫn với từng người dùng.
Google Ads là một nền tảng quảng cáo trực tuyến cho phép các doanh nghiệp tạo ra các quảng cáo nhắm mục tiêu, hiển thị trên kết quả tìm kiếm của Google và các trang web đối tác.
URL dịch vụ: policies.google.com (mở trong cửa sổ mới)
Bạn có thể tìm thêm thông tin trong Chính sách Cookie và Chính sách Bảo mật của chúng tôi.