← SalesNow Inc.
Remote Data Engineer - AI Data Platform Japan (Python)
SalesNow Inc. ·
Ứng tuyển tại trang chính thức ↗
Loại hình
Toàn thời gian
Hình thức
Tại văn phòng
Cấp bậc
Nhân viên
Ngành nghề
Kỹ thuật / Cơ khí
Mức lương
26tr - 64tr
Địa điểm
Remote
Tổng quan
- Thách thức kỹ thuật:
- Thiết kế và triển khai hệ thống web scraping quy mô lớn, trích xuất dữ liệu có cấu trúc một cách ổn định từ nhiều nguồn khác nhau.
- Xây dựng pipeline tích hợp API cho các nguồn dữ liệu đối tác, kèm kiểm tra schema và phát hiện bất thường.
- Thiết kế pipeline nạp dữ liệu thời gian thực cho cập nhật hằng ngày, với mục tiêu độ trễ dưới một phút.
- Xây dựng và duy trì các model dbt chuyển dữ liệu thô sang schema thống nhất của SalesNow.
- Định nghĩa SLA chất lượng dữ liệu (độ chính xác, độ đầy đủ, độ mới) và xây dashboard giám sát cảnh báo trước khi khách hàng nhận ra vấn đề.
- Triển khai entity resolution và khử trùng lặp ở quy mô lớn: đối sánh bản ghi doanh nghiệp giữa các nguồn có định dạng, quy ước đặt tên và định danh khác nhau.
- Điều phối các Airflow DAG phức tạp xuyên suốt thu thập, biến đổi, làm giàu và phân phối dữ liệu.
- Tối ưu cụm PostgreSQL và Elasticsearch / OpenSearch (hơn 100 triệu document trong chỉ mục tìm kiếm) để truy vấn phản hồi ở mức mili giây.
- Thiết kế pipeline chịu lỗi, tự phục hồi sau sự cố, với khả năng quan sát rõ ràng ở mọi giai đoạn.
- Đưa dữ liệu có cấu trúc vào các RAG pipeline và hệ thống AI agent thông qua SalesNow MCP.
- Xây dựng lớp phân phối dữ liệu để AI agent truy vấn theo thời gian thực cho quy trình của khách hàng doanh nghiệp.
- Làm việc với Amazon Bedrock, Claude và Gemini để cải thiện cách hệ thống AI sử dụng dữ liệu doanh nghiệp có cấu trúc.
- Xác định một tin tuyển dụng còn mở hay đã đóng. Logic phát hiện đóng tin hiện chia thành ba hệ thống và hành vi khác nhau tùy nguồn. Một số nguồn không hiển thị trạng thái đóng trên trang danh sách, nên phương pháp so sánh chênh lệch có thể đóng nhầm khi crawl bị lỗi tạm thời.
- Thiết kế quy trình thu thập thông tin website của mọi doanh nghiệp và theo dõi liên tục các thay đổi.
- Khi để AI kiểm chứng độc lập logic suy luận doanh nghiệp khách hàng đứng sau các tin tuyển dụng freelance, chỉ 12 trên 100 trường hợp xác định được với bằng chứng rõ ràng. Chúng tôi đã sửa lại logic để chỉ kết luận khi có căn cứ.
- Cách chúng tôi làm việc với AI:
- Mọi người đều dùng được Claude và Gemini. Chúng tôi cũng dùng Codex và chọn model theo từng loại công việc.
- Chúng tôi nhờ nhiều LLM review công việc, còn con người kiểm tra căn cứ và quyết định áp dụng hay không. Với kiểm tra dữ liệu, chúng tôi dùng LLM as a Judge theo tiêu chí do con người đặt ra.
- Sau khi thống nhất mục tiêu và ngân sách, người phụ trách tự quyết định cách tiến hành và dùng AI ở đâu.
- Mọi vị trí đều được kỳ vọng tự tái thiết kế công việc của mình bằng AI. Ban lãnh đạo của chúng tôi cũng viết code.
- Môi trường làm việc xuyên ngôn ngữ:
- PRD đầy đủ và chính xác. Công việc được giao kèm PRD, nên bạn biết rõ cần làm gì trước khi bắt đầu, và hai bên thống nhất được thời hạn.
- GitHub, Notion, Slack đều có dịch thuật. Pull request, tài liệu và trao đổi hằng ngày đều đi qua công cụ dịch, nên bạn đọc và viết bằng ngôn ngữ mình thoải mái nhất.
- Công cụ dịch AI do công ty chi trả. Thành viên không nói tiếng Nhật trao đổi công việc qua phiên dịch đồng thời bằng AI. Phỏng vấn cũng vậy.
- Ngôn ngữ: Python (FastAPI), SQL, Scala
- Biến đổi dữ liệu: dbt
- Điều phối: Airflow (MWAA)
- Xử lý dữ liệu: Databricks (Spark / Delta Lake), Scrapy
- Infrastructure as code: Terraform
- Cơ sở dữ liệu: PostgreSQL, Elasticsearch, OpenSearch
- Cloud: AWS (chính), Vercel
- AI/ML: Amazon Bedrock, Claude, Gemini
- Công cụ phát triển: Claude Code, Codex, Cursor, GitHub Copilot, CodeRabbit
- CI/CD: GitHub Actions
- Giao tiếp: Slack, GitHub, Notion
Yêu cầu
- Từ 2 năm kinh nghiệm data engineering chuyên nghiệp, xây dựng và duy trì pipeline dữ liệu chạy production (không phải đồ án học thuật hay PoC chưa từng triển khai).
- Thành thạo Python: viết code pipeline sạch, kiểm thử được.
- Thành thạo SQL: truy vấn phức tạp, window function, tối ưu truy vấn.
- Kinh nghiệm với ít nhất một công cụ điều phối: Airflow, Dagster, Prefect hoặc tương đương.
- Kinh nghiệm với cơ sở dữ liệu quan hệ ở quy mô lớn. Ưu tiên PostgreSQL; MySQL hoặc tương tự cũng được nếu bạn sẵn sàng học.
- Tiếng Anh đủ dùng trong công việc.
- Kinh nghiệm Elasticsearch hoặc OpenSearch ở quy mô lớn.
- Kinh nghiệm dbt.
- Web scraping hoặc hệ thống thu thập dữ liệu quy mô lớn.
- Kinh nghiệm với framework và giám sát chất lượng dữ liệu.
- Kinh nghiệm AWS (S3, Lambda, ECS, RDS, v.v.).
- Kinh nghiệm RAG pipeline hoặc vector database.
- Kinh nghiệm xử lý trên 1 triệu bản ghi mỗi ngày.
- Tiếng Nhật (JLPT N3 trở lên). Không bắt buộc, nhưng giúp bạn làm việc gần hơn với các đội business và mở rộng lựa chọn nghề nghiệp trong công ty.
- Chúng tôi tìm người như thế nào
- Bạn đồng cảm với sứ mệnh của SalesNow「誰もが活躍できる仕組みをつくる。」(Tạo ra cơ chế để ai cũng có thể phát huy năng lực) và các giá trị của chúng tôi (AI Native, Kotoshikou — hướng đến bản chất, và Chất lượng cao nhất).
- Bạn thích nhịp độ nhanh. Ngay cả khi mọi thứ thay đổi, bạn xuất phát từ mục đích, tìm ra vấn đề và theo đuổi đến khi giải quyết xong.
- Bạn làm việc với đồng đội và khách hàng bằng sự chính trực và tinh thần làm chủ.
- Bạn coi trọng chất lượng dữ liệu và bảo vệ nó bằng cơ chế, không chỉ bằng kiểm tra thủ công.
- Bạn đối chiếu kết quả của AI với bằng chứng trước khi áp dụng.
- Bạn giải thích được các quyết định thiết kế của mình, bao gồm cả chi phí, cho đồng nghiệp ở ngôn ngữ khác.
Tóm tắt thông tin từ tin tuyển dụng chính thức. Xem bản gốc ↗
Quan tâm đến vị trí này?
Bạn sẽ được chuyển đến trang ứng tuyển chính thức của nhà tuyển dụng.
Ứng tuyển tại trang chính thức ↗
Đây là doanh nghiệp của bạn?
Nhận quản lý trang, yêu cầu chỉnh sửa hoặc gỡ bỏ
→